打电话的时候咳嗽一声、旁边有人插话、背景是嘈杂的马路——这些日常场景放在以前的外呼机器人身上,基本就等于对话结束。系统识别不出来客户在说什么,要么重复问一遍,要么直接跳流程。但现在的智能外呼系统,面对这些意外情况已经能应付得有模有样了。
问题来了:它到底是怎么听懂人话的?这个听懂的程度又到了什么水平?拆开技术层面看,其实就是两步走——先把声音变成文字,再把文字变成意思。两步都过了,才算真听懂。
语音识别这关已经过了大部分
第一步叫自动语音识别,行话叫ASR。就是把客户说的话实时转写成文字。这个技术单独拎出来说,其实已经相当成熟了。平时用的语音输入法、会议转写工具,背后都是类似的技术。
但电话场景比手机输入麻烦多了。电话信道压缩严重,音质比面对面说话差远了;客户可能口音重、语速快、边说边想;还有各种背景噪音——车里、街上、办公室里开着空调。早期的语音识别在这种环境下错误率高得吓人,识别出来的文字颠三倒四,后面的理解自然全错。
现在的智能外呼系统用的是深度学习模型,在语音数据上做过专门训练。对噪音、电话音质这些场景比前几年好了不止一个档次。普通话标准的情况下,识别准确率已经能到百分之九十五以上。即便客户带点口音,只要不是特别偏的方言,理解个七八成没问题。
真正的难点在语义理解
声音变成文字之后,第二步才是硬骨头:这些文字到底是什么意思?这一步叫自然语言理解,行话叫NLU。
举个最常见的例子。客户在电话里说"我先考虑考虑"。这句话字面意思是在思考,但实际可能是婉拒,也可能是真的需要回去商量,还可能是价格不满意但不好意思直说。以前的机器人听到"考虑考虑",可能就直接记录成"意向待定"然后结束通话了。
大模型时代的智能外呼系统,会结合上下文来判断这句话的真实含义。前面客户已经问了价格、问了交付周期、问了售后政策,最后说"考虑考虑",那大概率是在对比几个供应商;前面刚介绍完产品,客户直接说"考虑考虑",那基本就是婉拒。系统会根据不同语境给出不同的后续策略——前者可能追问一句"主要是在对比哪方面呢",后者就礼貌结束不纠缠。
这种上下文推理能力,是传统规则式系统无论如何也做不到的。因为规则是人写的,人不可能把客户所有可能的表达方式都穷举出来。大模型是通过阅读海量文本学到的语言规律,它知道在什么语境下一句话通常是什么意思。

打断和插话怎么处理
真实通话里还有个很现实的问题:客户经常打断说话。机器人正在介绍产品,客户突然插一句"这个多少钱"。传统系统的反应是——要么假装没听见继续念稿,要么等自己说完再跳转,客户早就不耐烦挂了。
好的智能外呼系统现在支持打断检测。它在说话的同时一直在监听对方有没有出声,一旦检测到客户开始说话,立刻停下来把话语权交出去。客户说完之后,它再根据刚听到的内容接下去,而不是回到原来的话术流程继续念。
这个细节看似不起眼,但对体验影响极大。能被打断、能随时接话,对话才像两个人在交流;不能打断、必须等它说完,一听就是个机器。
智能外呼听懂人话的能力确实进步飞快,但还远没到完美的地步。知道它在哪些场景下靠谱、哪些场景下容易翻车,才能把它用在刀刃上。

微信公众号
