Published
2026-08-04
Section
Articles
How to Cite
基于轻量化 Transformer 的手语识别系统研究
邓 宇航
泉州信息工程学院 机械与电气工程学院
李 佳慧
泉州信息工程学院 机械与电气工程学院
陈 辉金
泉州信息工程学院 机械与电气工程学院
王 海涛
泉州信息工程学院 机械与电气工程学院
DOI: https://doi.org/10.59429/kxjsyy.v3i3.14794
Keywords: 手语识别;Transformer;轻量化;关键点检测;MediaPipe
Abstract
为应对手语识别系统在边缘设备部署中面临的计算资源受限问题,本文提出一种基于轻量化 Transformer 的 实时手语识别方法。该方法利用 MediaPipe 提取手部 21 个关键点的三维坐标作为特征输入,构建包含 3 层轻量化 Transformer 编码器的时序建模网络,将模型参数量控制在 61.2 万以内。在自建的 12 类中国手语数据集上,通过与 CNN1D、LSTM、GRU 等基线模型进行对比实验,验证了所提方法的有效性。实验结果表明,轻量化 Transformer 模型在验证集上的识别准确率达到 98.63%,F1 分数为 0.9864,其参数量仅为 LSTM 模型的 24.5%。通过系统的消融 实验,进一步揭示了模型维度、注意力头数、网络层数以及序列长度等关键超参数对模型性能的影响规律,为手语 识别技术在可穿戴设备等边缘场景中的实际部署提供了可行的轻量化解决方案。
References
[1] CAMGOZ N C, KOLLER O, HADFIELD S, et al. Sign language transformers: joint end-to-end sign language recognition and translation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. IEEE, 2020: 10023-10033.
[2] RASTOGI U, MAHAPATRA R P, KUMAR S. YOLOv10-ST: A hybrid model integrating Swin Transformer for improved sign language recognition[J]. Scientific Reports, 2024, 14(1): 18496.
[3] 宋浩翔 , 张旭 , 沈宏晔等. 基于 MediaPipe 的手语识别系统[J].物联网技术 ,2025,15(10):4-6.
[4] 路飞 , 韩祥祖 , 程显鹏等. 基于轻量 3D CNNs 和 Transformer 的手语识别[J].华中科技大学学报 ( 自然科学版 ),2023,51(5):13-18.
[5] 王琪. 基于深度学习的手语识别系统设计与实现[D].西安电子科技大学 ,2021.
[6] 刘星辰 , 杨瑞 , 刘林鑫等. 基于深度学习的中国通用手语识别系统[J].电脑与电信 ,2024,(11):43-47.DOI:10.15966/j.cnki.dnydx.2024.11.006.
[7] 马旭冉 , 陈圣贤 , 李熙文等. 基于改进 YOLOv5 算法的智能手语翻译方法研究[ J].电脑知识与技术 ,2025,21(24):36-39.
[8] 王雅锐. 基于卷积神经网络的手势识别[D].安徽理工大学 , 2025.
[9] 岳伟.基于三维骨架信息的连续手语识别研究[D].长安大学 , 2024.
[10] 边辉 , 孟畅乾 , 李子涵等. 基于图卷积网络和 CTC/ Attention 的连续手语识别[J].计算机科学 , 2025,52(S1):562-570.
[11] 杨逸峰. 融合手势姿态特征的传感器手语识别模型[D]. 江西师范大学 , 2024.
[12] VASWANI A, SHAZEER N, PARMAR N, et al. Attention is all you need[C]//Advances in Neural Information Processing Systems. 2017: 5998-6008.
[13] 王祉元. 基于 Transformer 的手语孤立词识别方法研究[D]. 哈尔滨工程大学 , 2023.
[14] 格梦茹. 基于 Transformer 的手语翻译研究[D]. 天津理工大学 , 2024.
[15] 孙意翔. 基于异构注意力机制的手语翻译方法研究[D]. 中南大学 , 2023.
[16] 刘凯. 基于多模态数据融合的手语识别研究[D]. 江西师范大学 , 2025.
[17] ALSHARIF B, ALALWANY E, IBRAHIM A, et al. Real-time American sign language interpretation using deep learning and keypoint tracking[J]. Sensors, 2025,25(7): 2138.
[18] 屈乐乐 , 洪雨云.基于 Transformer 元学习网络的毫米波雷达手势识别方法[J].雷达科学与技术 ,2025,23(4):407-416.
[19] 李沼洁 , 郭家毅 , 杨英东等. 融合 Transformer 和 CNN 的伪装目标检测[J ].福建理工大学学报 , 2025,23(6):557-563.
[20] 范忠岗 , 吴跃腾 , 巴顿等. 基于 Transformer 与强化学习的叶片与机匣处理一体化优化设计[J]. 工程热物理学报 , 2025,46(12):3995-4004.