|
语音识别ASR是 Auto Speech Recognition的简称。
ASR 技术最重要的现实意义就在于提供了一种脱离按键,键 盘,鼠标的基于语音的输入方法
使用语音技术的操作方法相对于键盘操作方法来说具有更快速,更自然的特点。
ASR 在最直接的应用:只需要直接念出想要拨打电话的人名,就可 以识别出结果,拨打出去
1. 非特定人语音识别
音航提供的语音识别技术是基于非特定人技术(Speaker-Independent)的语音识别,用户不需要作任何的训练,即可以使用。
收集上千人,几千小时的语音特征,讲话者中包括男女老少以及带口音的人。对几十 G 的数据经语言学家语音模型分析,科学家建立数学模型,并经过反复训练提取基元语音的细节特征,以及提取各基元间的特征差异。可以得到在统计概率最优化意义上的各个基元语音特征。最后才由资深工程师将算法以及语音模型描述为软件包以应用在各个系统中。
对比旧有的“语音标签”技术
语音标签实际上采用的是特定人语音识别技术(Speaker-Dependent ASR)。语音标签实用效果很差,原因如下:
经过训练及评测,如果用户可以对每一词条念20遍以上,识别精确度会很好,但由于用户不可能有这样的耐心进行训练,而现实中语音标签一般都要求用户念2遍,无法提取真正有效的语音特征作为识别特征。
同时,语音标签技术在超过100个以上的关键词语条目识别时,识别效果就会明显下降,无法支持实用的大容量的词汇识别。
2. 基于关键词语列表的识别
ASR技术是基于关键词语列表识别的技术。
每次识别的过程,就是把用户说出的语音内容,通过频谱转换为语音特征,和这个关键词语列表中的条目进行一一匹配,最为匹配的一个作为识别结果。
比如在手机的应用中,这个关键词语列表的内容就是电话本中的人名/手机的菜单命令/T卡中的歌曲名字。
不论这个列表的条目内容是什么,只需要通过ASR引擎的函数接口,把相应的条目内容以字符形式传递给识别引擎就可以。
因此,ASR技术可以做到的有:
- 非特定人语音识别技术,不需要用户在使用前进行录音训练
- 基于设定的待识别关键词语列表进行匹配,用人的说话声音去在列表中进行匹配,找出最相似的作为识别结果
- 语音识别ASR是基于关键词语列表的识别
- ASR技术需要存在一个关键词语列表,这个列表可以在手机运行时随时动态修改
- 用户说的语音应该只包括这个列表中所列出的关键词语
- 识别引擎不关心关键词语列表中的关键词语的内容,可以是命令,人名,歌曲名字,操作指令等等任何的汉字字符串
ASR技术上的局限性在于:
- ASR不是听写系统
- ASR不能把人的声音转换为确定的拼音串
- ASR 不能任意地识别人的说话内容
- ASR不能识别关键词语列表中的某个关键词语的一部分内容,除非这一部分内容自身也是一个关键词语
- ASR不可以识别与关键词语列表中列出的关键词语不相符的情况
比如,前后加了“嗯”,“阿”之类的语气词
比如,只说出了关键词语中的一部分而不是整个关键词语
比如,没有列在关键词语列表中的词语
3. ASR技术的算法基础
ASR技术的基础主要是信号处理和概率模型。
信号处理技术
基于时间的概率模型
语言模型
4. 目前ASR技术在各个产品领域内的应用场景
1)手机,嵌入设备领域
语音菜单,语音命令
语音拨号
语音点歌,语音点播视频
语音互动手机游戏
语音导航
2 ) 桌面系统软件
盲人上网软件
盲人操作电脑软件
游戏操作插件
智能机器人应答
3)呼叫中心系统软件
自动应答总机
自动下载歌曲,彩铃
银行自动客服系统
机场,宾馆自助查询系统
餐饮,时刻表,等信息查询
5. 音航公司的语音识别ASR技术的特点
在目前的手机/嵌入设备市场,音航公司提供的语音识别引擎成为了国内主流手机品牌厂商和设计公司的首选,主要的技术特点有:
1) 可以支持从最低端的手机平台到高端的手机平台
可以在目前最低端的MTK23/26/25 平台上提供受到客户市场认可的识别引擎
针对手机平台的运算性能以及ROM/RAM的资源,提供不同的识别引擎(4个不同等级)来适应从低端到高端的所有手机平台。在低端平台提供运行流畅的高效识别引擎,在高端平台提供识别更精确的高运算量识别引擎
2 )需要资源小
在最低端的MTK23平台上,需要的ROM空间为200KByte ,需要的RAM空间约为100K~140K(随最大识别容量变化),RAM可以与其他程序复用
在高端平台上提供的各档次的高运算量识别引擎,需要的Flash空间依次增加100K,RAM不增加
3) 运行效率高
在最低端的MTK23平台上依然可以在正常使用状态下,提供实时的识别引擎,用户体验的等待时间约为1~2秒钟
4)完全开放的开发接口
识别引擎的开发接口完全开放透明,设计人员可以根据自己产品的需求来改变上层的UI调用界面,改变调度识别引擎的流程,动态修改识别列表,从而开发出各种独特的应用
开发函数设计简单,合理。工程师可以在最短时间内完成移植
5)提供跨平台的识别引擎
识别引擎由纯ANSI C语言完成,可以在任何支持C语言编译的手机平台上提供识别引擎版本
已经完成移植的手机平台包括MTK,展讯,Philip,TI,ADI,Skyworks,WinCE/WindowsMobile/Linux
各个平台的开发接口函数一致,方便移植
6) 运行稳定,可靠
经过在各种手机平台的量产的检验,识别引擎运行稳定可靠,内存管理完备,运算函数调度合理
|