语音识别,说白了就是把人说的话变成文字的技术:它把你说话的声波切成一小段一小段,对照学过的“声音和字的对应规律”,猜出你最可能说的是哪几个字,再连成一句话。 微信语音转文字、音箱听口令、会议录音出纪要,靠的都是它。
先看一个你多半遇到过的场景。晚上在安静的家里,你对着手机说:“明天上午十点提醒我交电费。”语音输入一字不差地打了出来。第二天你在菜市场里说了同样一句话,转出来的却是“明天上午四点提醒交电费”——“十”变成了“四”,“我”字还丢了。同一个人、同一部手机、同一句话,差别为什么这么大?不是手机变笨了,是它收到的“原料”不一样了:你的声音里混进了叫卖声和讨价还价声,机器要先从一团乱哄哄的声波里把你的声音挑出来,再逐段猜字,难度完全不是一个级别。
同一句话,两种声音原料
- 01安静
声音清楚,易于转写
- 02嘈杂
噪声叠加,可能猜错
来自正文虚构情境,不是产品准确率测试。
机器是怎么把声音变成字的
下面按常见的分步思路拆开看;现代端到端模型可以把这些环节合在一起,不一定先输出一串发音再转文字。
1. 先把声音切成极短的小段。 麦克风把你的声音录成一串连续起伏的波形。常见处理方式会先把它切成几十毫秒一小段——一句几秒钟的话,切下来就是几百个小片段。
2. 逐段对照“声音模型”,猜发音。 每个小片段会被换算成一组声音特征(音高不高、能量集中在哪些频率上),然后拿去对照一个“声音模型”:长这样的声音,最可能是哪个发音。这个模型不是谁手工编的发音对照表,而是拿海量“录音配上对应文字”用机器学习练出来的——见得多了,它就知道什么样的波形多半对应什么音。
3. 把发音连成字,靠前后文定同音字。 单独一个音,候选字往往有一串:一个“shì”,可能是是、事、市、室。机器会把整句话放在一起看,挑最通顺的组合——“我去shì场买菜”,多半猜“市”。所以你会发现,说整句比一个字一个字蹦着说要准,上下文本身就是线索。
4. 全程是“猜最可能”,不是“听懂了”。 注意,这三步里没有一步是“理解”。它交出来的只是概率最高的那串字:猜对了,它并不知道这句话什么意思;猜错了,也不能指望它总能发现并纠正。这一点下面专门说。
为什么一吵、一带口音就容易错
从上面的流程能看出,识别准不准,取决于两个条件。
一是原料干不干净。 安静房间里,你的声音清清楚楚;菜市场里,你的声波和别人的声波叠在一起,机器要先干“挑声音”这道额外的活儿,挑不干净,后面猜字自然跟着错。几个人同时说话时更难——人能在饭局上盯住一个人的声音听,机器到现在也不擅长这件事。
二是模型练没练过这类声音。 如果一个模型主要用标准普通话训练,它对相似录音通常更熟;面对训练中覆盖较少的方言、口音或嗓音,准确率就可能下降。专门训练的方言模型则可能表现很好。这不是机器“歧视”方言,是它确实见得少。
这也顺带解释了,为什么语音输入总提醒你“离麦克风近一点、说慢一点”——本质上都是在帮你改善原料。
“识别出字”和“听懂意思”是两步
很多人觉得音箱“听懂了”命令,其实里面隔着两道工序。你对音箱说“把空调调到二十六度”:第一道,语音识别把声波变成一行字——这是本词讲的范围;第二道,理解程序读这行字,判断“这是在让我调空调”,再去执行——如今这道工序常由大语言模型一类的技术接手。
分成两步看,两件事就清楚了:第一,识别错一个字,后面全歪——“调到”被听成“关掉”,理解得再准也是南辕北辙;第二,字全对也不等于“懂了”——同样一句“你可真行”,是夸还是损,光看这行字是看不出来的。能同时处理声音、文字、图像好几种信息的 AI,叫多模态AI;语音识别只是其中“进耳朵”的那一环。
所以用语音输入发重要消息——尤其是带时间、数字、地址的——发出去之前扫一眼;录音转写出的会议纪要,关键处对照录音再确认。不是机器不靠谱,是“猜最可能的字”这活儿本身就允许出错。