语音识别原理
首先,我们知道声音实际上是一种波常见的mp3、wmv等格式都是压缩格式,必须转成非压缩的纯波形文件来处理,比如WindowsPCM文件,也就是俗称的wav文件wav文件里存储的除了文件头以外,就是声音波形的个点了
在开始语音识别之前,有时需要把首尾端的静音切除,降低对后续步骤造成的干扰这个静音切除的操作一般称为VAD,需要用到信号处理的一些技术要对声音进行分析,需要对声音分帧,也就是把声音切开成一小段一小段,每小段称为一帧分帧操作一般不是简单的切开,而是使用移动窗函数来实现,这里不详述帧与帧之间一般是有交叠的
每帧的长度为25毫秒,每两帧之间有25-10=15毫秒的交叠我们称为以帧长25ms、帧移10ms分帧每帧的长度为25毫秒,每两帧之间有25-10=15毫秒的交叠我们称为以帧长25ms、帧移10ms分帧
分帧后,语音就变成了很多小段但波形在时域上几乎没有描述能力,因此必须将波形作变换常见的一种变换方法是提取MFCC特征,根据人耳的生理特性,把每一帧波形变成多维向量,可以简单地理解为这个向量包含了这帧语音的内容信息这个过程叫做声学特征提取实际应用中,这一步有很多细节,声学特征也不止有MFCC这一种,具体这里不讲
至此,声音就成了12行(假设声学特征是12维)、N列的矩阵,称之为观察序列,这里N为总帧数观察序列如下图所示,图中,每一帧都用12维的向量表示,色块的颜色深浅表示向量值的大小
接下来就要介绍怎样把这个矩阵变成文本了首先要介绍两个概念:音素:单词的发音由音素构成对英语,一种常用的音素集是卡内基梅隆大学的一套由39个音素构成的音素集,参见TheCMUPronouncingDictionary汉语一般直接用全部声母和韵母作为音素集,另外汉语识别还分有调无调,不详述状态:这里理解成比音素更细致的语音单位就行啦通常把音素划分成3个状态
语音识别是怎么工作的呢实际上一点都不神秘,无非是:第一步,把帧识别成状态(难点);第二步,把状态组合成音素;第三步,把音素组合成单词
免责声明:本文由用户上传,与本网站立场无关。财经信息仅供读者参考,并不构成投资建议。投资者据此操作,风险自担。 如有侵权请联系删除!
-
【首都师范大学是211吗】一、“首都师范大学是211吗”是许多考生和家长在选择大学时经常提出的问题。实际上,...浏览全文>>
-
【首都师范大学科德学院自考和统招毕业证不一样吗有什么不一样的】在选择继续教育方式时,很多学生都会关注“...浏览全文>>
-
【首都师范大学科德学院自考本科国家承认学历吗】一、“首都师范大学科德学院自考本科国家承认学历吗”是许多...浏览全文>>
-
【首都师范大学科德学院怎么样首都师范大学科德学院介绍】首都师范大学科德学院是一所位于北京市的全日制本科...浏览全文>>
-
【第一次电影剧情】《第一次》是一部由美国导演理查德·林克莱特(Richard Linklater)执导的电影,于2004年...浏览全文>>
-
【首都师范大学科德学院学费一年多少钱】首都师范大学科德学院是一所经教育部批准设立的全日制本科独立学院,...浏览全文>>
-
【第一次点外卖的流程】对于第一次尝试点外卖的人来说,整个过程可能会有些陌生。不过,只要按照步骤来,就能...浏览全文>>
-
【首都师范大学科德学院学费为什么要这么贵】首都师范大学科德学院作为一所独立学院,近年来在学费方面引发了...浏览全文>>
-
【第一次登泰山的忌讳】泰山,作为五岳之首,不仅是中国文化的重要象征,也是无数人心中的朝圣之地。对于第一...浏览全文>>
-
【首都师范大学科德学院位于哪个城市】首都师范大学科德学院是一所独立学院,隶属于首都师范大学。对于许多学...浏览全文>>