上周我把家里那台旧智能音箱拆了听懂欧博会员登录,螺丝刀刚撬开后盖,就看见一颗指甲盖巨细的黑色方块是印着某厂logo的语音识别 AI 芯片。它没连网了。却能听懂我带着方止味的语音夜地“下一首”。

那玩意儿让我愣了半分钟,本来机械听人话,早就不靠云端阿谁年夜机房了啊?以前做语音识别,得把录音传到办事器,等功效再传回来的识别。汇集一卡的,你说“关灯”,灯得愣三秒才灭,像个回响反映笨钝的室友。如今那颗AI芯片把神经汇集塞进当地了。麦克风阵列收到声音,芯片芯片间接跑模子,几十毫秒出功效吧?我试过正在电梯里对耳机说“播放播客”,没疑号照样切歌是那种直爽感,跟按下开关灯就亮一样自然。
详细点说,那类芯片普通会集成DSP把塞、NPU和一小块内存的。DSP负责把情况噪音压下去,NPU专门跑语音叫醉和识别模子。有次我正在嘈纯的暖锅店测试,隔邻桌划拳声快掀翻屋顶了,耳机仍进米是精确抓到了“接电话”三个字。
固然,它也不是全能。我居心用超快语速混着英文说“set 个闹钟”。它犹豫了一秒,最后给我设了个“七个闹钟”粒年。挺好笑,至少没把指令传到千里之中的办事器上。我越来越觉得,当地语音处理的实正价值就是“更懂分寸”。云端年夜模子像知识广博魔法的传授,什么都能聊啊,你不念每句悄悄话都让他听见。当地芯片像住正在家里的管家,只处理叫醉词和常用指令,敏感内容不出门。朋友做儿童故事机,以前家长忧虑录音上传的,换了离线芯片后。
故事机断网也能对暗记,销量居然涨了一波。固然了,应战也很多。
当地算力有限,方止、近场、多轮对话仍是硬骨头。我试过让一个小芯片听懂四川话“把空调开到二十六度”,它把“二十六”听成了“二十六楼”,间接给我推了个电梯告白。哭笑不得。趋背很较着,语音识别 AI 芯片正正在旗舰手机下放还有几十块的玩具、灯泡、门锁吧?或许明年。你买的每一颗白菜都带个语音标签?开个玩笑了。不中机械耳朵变廉价、变私密、变快,那件事曾经发作了。

