Skip to content

【外滩大会2026】PalmSpeech 掌语——Apple Silicon 完全离线实时手语识别与语音播报系统 #113

Description

@tbszz

参赛项目名称

PalmSpeech 掌语——Apple Silicon 完全离线实时手语识别与语音播报系统

团队 / 作者

DevX

我做了什么

我使用 OpenWork / 百炼 CLI、Qwen3-Coder-Plus 和自定义 Skill hand-sign-offline-deployer,完成了一套面向 Apple Silicon Mac 的完全离线实时手语识别系统。

开发过程中,我将手部关键点数据重新整理为连续动作序列,构建了“MediaPipe 手部关键点提取 + 16 帧双向 GRU 时序建模 + 注意力分类”的识别流程。系统目前可以识别 100 个孤立手语词动作,并将结果实时转换为中文语义,同时显示置信度、历史识别结果,并调用 macOS 本地语音进行播报。

系统支持电脑内置摄像头和 ESP32 网络摄像头两种输入方式。针对网络视频延迟,我设计了后台接收、仅保留最新帧、JPEG 完整性检查和断线自动重连机制。最终将模型、Python 运行环境及全部依赖封装成 Apple Silicon 离线程序。用户无需安装 Python 或配置开发环境,双击即可运行,摄像头画面也不会上传云端。

使用的工具

  • OpenWork / 百炼 CLI
  • 百炼能力 / 模型:Qwen3-Coder-Plus
  • Skill 名称:hand-sign-offline-deployer
  • 其他:Python、PyTorch、MediaPipe、OpenCV、BiGRU、WebSocket、ESP32-CAM、PyInstaller、macOS 本地语音引擎

效果展示

项目目前支持 100 个孤立手语词动作的实时识别,包括“帮助、需要、是、不、喝、吃、工作、学习、医生、家庭”等常用语义。

当前模型效果:

  • 输入时序窗口:16 帧
  • 识别类别:100 类
  • 验证集 Top-1 准确率:77.2%
  • 验证集 Top-5 准确率:91.5%
  • 模型大小:约 2.3 MB
  • 支持中文语义和置信度实时显示
  • 支持最近识别结果记录
  • 支持中文语音播报
  • 支持电脑内置摄像头和 ESP32 网络摄像头
  • 支持 Apple M1、M2、M3、M4 系列芯片
  • 整个识别过程完全离线运行

项目附带“帮助、需要、是、不、喝、吃”6 个独立动作演示视频和 1 个动作合集视频,可用于展示模型的动作类别与时序识别效果。

项目链接

https://sign.orionsheep.com/

踩坑记录

首先,单帧分类无法准确描述手语动作的运动过程。部分动作的静态手形很相似,只有结合运动方向和前后变化才能区分。因此,我将关键点数据重建为连续 16 帧序列,并使用双向 GRU 和注意力机制提取时序特征。

其次,不同用户的手部大小、位置和拍摄距离存在差异。我在原始关键点坐标之外加入了腕部相对坐标、手掌尺度归一化坐标,以及 21 个关键点之间的两两距离,使模型更加关注手形结构和动作本身。

实时识别还容易出现结果抖动和重复播报。为此,我加入连续窗口概率平均、置信度阈值、稳定类别计数和动作结束后重新激活机制。只有识别结果连续稳定后,系统才会确认和播报。

ESP32 摄像头的传输速度和电脑推理速度不完全一致,逐帧排队会导致延迟不断增加。我使用独立线程接收视频,并始终只保留最新画面,同时增加消息大小限制、JPEG 完整性检查和断线自动重连。

最后,Apple Silicon 离线部署需要完整打包 PyTorch、MediaPipe、OpenCV 及相关动态库。我将模型、运行时和依赖封装到独立程序中,并制作了内置摄像头、网络摄像头和首次运行解锁脚本,让没有 Python 环境的用户也能直接使用。

Metadata

Metadata

Assignees

No one assigned

    Labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions