为什么手语 AI 长期滞后
在全球范围内,听障与重听人群超过 7000 万,他们所使用的 200 多种手语至今没有被主流语音处理技术覆盖。过去十年里,语音转写、实时翻译、对话式助手等技术快速普及,但手语用户依然缺乏对等的输入工具——他们大多仍依赖键盘或语音转录代理。
造成这种滞后的原因有两层:一是认知误区,许多人把手语简单理解为"用手比划的英语",忽略了手语自身独立的语法、词汇和空间构词规则;二是技术挑战,手语翻译需要同时追踪双手、手臂、躯干、头部和面部的高频运动,并把这些运动映射为另一种语言,远比声波到文字的序列映射复杂。早期的"手语手套"类产品因此在本质上受限,无法覆盖真实手语。
SL2T 的核心思路
SL2T(Sign-Language-to-Text)把两个独立的能力组合到一起:
- 整机视觉感知:手机端使用 MediaPipe Holistic 实时跟踪使用者身体的关键点(pose landmark),只把这些几何坐标上传到服务器用于翻译,原始视频可以立即丢弃。这在设计上把隐私保护放在链路前端。
- 直接机器翻译:模型跳过传统研究中常见的"gloss 中间表示",把关键点序列直接翻译为目标语言文本。这一选择绕开了 gloss 无法表达的非手部标记和空间结构,也不再受人工词表上限的限制。
训练数据规模是 SL2T 的另一基础。模型在超过 10 万小时、覆盖 50 多种手语的数据上联合训练,其中约四分之一为美国手语(ASL)。跨语种、跨方言、跨熟练度的混合训练让模型学到更通用的结构,在内部实验中优于单语种模型。
性能与基准
在公开的 FLEURS-ASL(sd-test)基准上,SL2T 在零样本设置下取得 70 BLEURT,是该基准此前已报告成绩中的最高水平。但官方团队也明确指出,基准分数不能等同于真实可用性。因此模型在以下工程层面做了优化:
- 流式延迟最小化,适合边说边译的场景
- 对非手语画面抑制"幻觉"输出
- 兼顾约 10% 的左手手语者
- 改善"单手手语"(另一只手持机)时的表现
当前仍存在的局限
即使是这一代模型,也存在已知的失败模式,主要集中在:
- 罕见手语词汇
- 快速手指拼写(如把"prey"误判为"grey")
- 被动句式
- 分类器描述(classifier depictions),容易丢失关键细节
- 缺乏语境时的时态判断(如"kicked off"被译为"start")
这些局限意味着 SL2T 适合作为日常输入的辅助手段,而不是对精确文本负全部责任的最终系统。对于重要沟通、合同、医疗或法律场景,建议结合人工校对。
在产品中的使用方式
目前 SL2T 已经驱动 Gboard 的手语输入以及 Pixel 11 上的 Live Transcribe,初期支持 ASL 转英语,机型暂时限定在 Pixel 11,更多设备将陆续支持,后续也会增加其他手语。用户可以在本应打字的任何场景使用手语输入:网页搜索、起草消息或文档、向 Gemini 发起查询;在 Live Transcribe 中,聋人参与者也可以直接用手语回应,而不必反复切换到键盘。
对潜在用户的实践建议:
- 先用熟悉的短句测试:在稳定光线和背景简单的环境下,从问候句、自我介绍开始,逐步过渡到复杂句式
- 保持合适的拍摄距离与角度:上半身和面部清晰可见能让关键点更稳定
- 注意非手部信号:眉毛、口型、头向都是手语的一部分,简化或省略会影响翻译质量
- 左手用户:模型已纳入左手优化,但仍建议在初次使用时多测试不同方位
- 重要内容务必复核:尤其涉及数字、专有名词、被动语态和长句时,把输出当作草稿而非定稿
共建与治理
该项目的特别之处在于从一开始就把听障社区作为合作方,而非单纯的测试对象:项目由听障员工发起概念,数据采集与用户研究都和听障伙伴共同完成,并成立了 AI 手语咨询委员会(AISLAC),让受影响最大的社群直接参与开发优先级与影响评估。SL2T 1.0 在 Gboard 与 Live Transcribe 发布时同步公开了联合影响报告,详述能力边界与现存不足。
展望
官方把这次发布定位为起点而非终点。未来路线包括扩展更多手语、增加手语生成能力(文本到手语视频),并把前沿模型能力融入无障碍体验。目标是让通过手语访问数字世界成为默认配置,而不是少数人的特例。
需要强调的是:以上技术细节、基准成绩、设备范围和功能描述均来自公开发布内容,是否如期上线、覆盖哪些语种与机型,仍以最终实际产品为准。