【VS开发】【智能语音处理】特定人语音识别算法

【VS开发】【智能语音处理】特定人语音识别算法—DTW算法

DTW（动态时间弯折）算法原理：基于动态规划（DP）的思想，解决发音长短不一的模板匹配问题。相比HMM模型算法，DTW算法的训练几乎不需要额外的计算。所以在孤立词语音识别中，DTW算法仍得到广泛的应用。

在训练和识别阶段，首先采用端点检测算法确定语音的起点和终点。对于参考模板{R(1),R(2),…,R(m),…,R(M)}，R(m)为第m帧的语音特征矢量。对于测试模板{T(1),T(2),…,T(n),…,T(N)}，T(n)为测试模板的第n帧的语音特征矢量。参考模板与测试模板一般采用类型的特征矢量、相同的帧长、相同的窗函数和相同的帧移。

对于测试和参考模板T和R，它们之间的相似度之间的距离D[T，R]，距离越小则相似度越高。在DTW算法中通常采用欧氏距离表示。对于N和M不相同的情况，需要考虑T(n)和R(m)对齐。一般采用动态规划（DP）的方法将实现T到R的映射。

将测试模板的各个帧号n=1~N在一个二维直角坐标系中的横轴上标出，参考模板的各帧号m=1~M在纵轴上标出，通过这些表示帧号的整数坐标画出一些纵横线即可形成一个网格，网格中的每一个交叉点(n,m)表示测试模式中某一帧与训练模式中某一帧的交汇点。DP算法可以归结为寻找一条通过此网格中若干格点的路径，路径通过的格点即为测试和参考模板中进行距离计算的帧号。所选的路径必定是从左下角出发，在右上角结束。

为了使路径不至于过分倾斜，可以约束斜率在0.5~2的范围内，如果路径已通过格点