国内智能语音行业分析报告( 七 )

至此,声音就成了一个12行(假设声学特征是12维)、N列的一个矩阵,称之为观察序列,这里N为总帧数。观察序列如下图所示,图中,每一帧都用一个12维的向量表示,色块的颜色深浅表示向量值的大小。

国内智能语音行业分析报告

再次,就是讲声音向量矩阵变成文本了,在这之前,有两个概念需要给大家先介绍下:

音素:单词的发音由音素构成。对英语,一种常用的音素集是卡内基梅隆大学的一套由39个音素构成的音素集,而汉语一般直接用全部声母和韵母作为音素集,另外汉语识别还分有调无调。状态:比音素更细致的语音单位就行啦。通常把一个音素划分成3个状态。了解了概念之后,我们就看一下语音识别是怎么把声音变成文本的,其实就和我们把大象塞进冰箱一样,也是分为三步:

把帧识别成状态(难点);把状态组合成音素;把音素组合成单词。如下图所示:

国内智能语音行业分析报告

推荐阅读