这次升级到底改了什么:不只是"更准",是能听懂更多人在说什么
语音输入功能在很多输入法里都有,但大部分只支持标准普通话。问题是——不是每个人都讲一口标准的普通话。中国有超过 4 亿人日常使用方言,其中相当一部分人说的普通话带有明显的方言口音。以前这些用户用语音输入,准确率会大打折扣,用着用着就放弃了。
搜狗输入法这次升级的核心思路是:与其让用户去适应语音识别模型,不如让模型去适应用户。新版本在底层声学模型上做了两个关键改进:一是训练数据里大幅增加了方言口音的普通话样本,让模型对带口音的普通话识别更稳定;二是新增了 12 种方言的独立识别通道,用户可以直接用方言说话,输入法直接用普通话文字输出。
支持的 12 种方言是:粤语(广东话)、四川话、上海话、闽南话、客家话、湖南话、陕西话、东北话、河南话、山东话、江西话和吴语。这个列表会持续扩展,后续版本中还会加入更多地方方言。
你可能想问的几个问题
方言识别的准确率到底怎么样?跟普通话比差多少?
安静环境下,粤语的识别准确率约 97.2%,四川话约 96.5%,上海话约 95.8%,其他方言在 93%-96% 之间。比普通话的 98.7% 稍低一些,但已经达到了日常可用的水平。方言内部的细分变体(比如粤语的广府片和四邑片)准确率会有波动,团队正在持续补充训练数据。
语音输入需要联网吗?
需要。语音识别模型(约 800MB)目前运行在云端服务器上,主要是为了兼顾准确率和设备端的存储和算力限制。不过音频数据在转写完成后即时删除,不会留存用于其他用途。离线轻量版语音识别(仅支持普通话,准确率约 92%)正在开发中,预计年内推出。
嘈杂环境下还能用吗?
我们在模型训练中加入了大量噪声数据增强(街道噪声、咖啡厅背景音、车内噪音等),在中等噪声环境下(60-70分贝),普通话准确率仍然有 94% 左右。但如果背景音太吵(比如正在放音乐或者旁边有人在说话),建议还是用键盘打。
语音输入好在哪:三个场景说明问题
场景一:开会记笔记。领导在讲话,你在下面打字,打完一行漏了两行。用语音输入把手机放在桌上,自动转写会议内容,一分钟 200 字,比手打快太多。
场景二:跟长辈发微信。很多中老年用户不会拼音,手写又慢。现在他们可以直接对着手机说方言——"阿仔今晚翻唔翻来食饭?"(粤语),屏幕上自动转成文字发出去。这个功能对不熟悉拼音的用户群体来说,好用程度提升了一个数量级。
场景三:开车时回消息。开车不能碰手机,但语音输入可以。说出你要回的内容,搜狗输入法自动转文字,安全又高效。
怎么开启语音和方言识别
- 在输入法键盘上点击麦克风图标(如果没有显示,去设置里把语音按钮加到工具栏)。
- 第一次使用需要授权麦克风权限,系统会弹出提示,点击"允许"即可。
- 点击语音面板左上角的语言选择按钮,在列表里选择你要使用的语言/方言。
- 开始说话,识别结果会实时显示在候选栏区域,说完后点击"发送"或直接按回车确认。
- 如果你同时讲普通话和某一种方言,可以在设置里开启"自动语言检测",输入法会自动判断并切换识别通道。