康奈尔大学研究团队开发无声沟通技术,利用声纳眼镜执行任务
【本站】4月10日消息,美国康奈尔大学的研究人员开发了一种新技术,可以通过声纳眼镜进行无声沟通。这种眼镜利用微型扬声器和麦克风来读取佩戴者默念的单词,从而可以在不需要物理输入的情况下执行各种任务。
该声纳眼镜使用一种名为 EchoSpeech 的无声语音识别接口,利用声纳来感知嘴部运动,同时使用一个深度学习算法实时分析回波特征。这使得系统能够以约 95% 的准确率识别佩戴者默念的单词。该系统目前能够识别 31 个孤立的命令和一串连续的数字,并且错误率低于 10%。据本站了解,该系统只需要几分钟的训练数据来学习用户的语音模式,学习完成后,就可以朝用户的脸上发送和接收声波。
这项技术最令人兴奋的前景之一是,对于有语言障碍的人来说,可以使用它来无声地将对话输入到语音合成器中,然后将单词大声说出来。眼镜也可以用来在安静的图书馆中控制音乐播放,或者在嘈杂的音乐会上口述信息。该技术既小巧又低功耗,也不会侵犯隐私,因为没有数据离开用户的手机。这样,就不会有隐私方面的担忧。眼镜佩戴非常方便,比其他可用的无声语音识别技术更实用、更可行。
该系统目前的版本提供了大约 10 小时的电池续航,并且可以通过蓝牙无线地与用户的智能手机通信。智能手机负责处理和预测所有数据,并将结果传输到一些“动作键”,让它可以播放音乐、与智能设备交互或激活语音助手。康奈尔大学智能计算机接口未来交互(SciFi)实验室正在利用康奈尔大学的一个资助计划来探索将这项技术商业化的可能性。
相关文章
- OpenAI或推出GPT-5,商标申请进展曝光
- 生成式AI服务管理不影响企业科研攻关及自动驾驶等领域
- Azure AI文本转语音升级:男声"Ryan"登场,语言支持大幅扩展
- 微软研究院展示"Project Rumi":多模态AI项目助力理解人类意图
- 阿里云通义千问:开源免费、助力企业打造专属大模型
- 苏姿丰:预计今年下半年PC市场将因AI需求增长而复苏
- 智能化改进助力宝马生产线:AI降低成本提高效率
- 英特尔与埃森哲联手推出34个开源AI参考套件,助力AI部署
- 国产 1400 亿参数知未智能 KDF 大模型发布,聚焦金融和商业垂直领域
- 人工智能芯片市场潜力巨大 台积电或获新发展契机
- GitHub Copilot Chat企业测试版发布:AI智能助手为开发者提供代码支持和交互体验
- LG发布EXAONE 2.0:支持多模态语言处理的大语言模型
- LG发布EXAONE 2.0:支持多模态语言处理的大语言模型
- 斯坦福大学和加州大学伯克利分校的研究:GPT-4智能下降
- 斯坦福大学和加州大学伯克利分校的研究:GPT-4智能下降
- 华为联合山东能源集团实现矿山领域AI落地,开创工厂化开发模式
