节点文献

汉语语音识别中基频特征的直接声学建模方法

Direct F0 incorporation for acoustic modeling in Mandarin speech recognition

  • 推荐 CAJ下载
  • PDF下载
  • 不支持迅雷等下载工具,请取消加速工具后下载。

【作者】 黄浩哈力旦

【Author】 HUANG Hao1,Halidan21.Department of Information Science and Engineering,Xinjiang University,Urumqi 830046,China 2.Department of Electrical Engineering,Xinjiang University,Urumqi 830046,China

【机构】 新疆大学信息科学与工程学院新疆大学电气工程学院

【摘要】 提出了隐条件随机场对断续基音频率序列进行直接声学建模的方法,该方法针对汉语语音中基频值在清音段连续,浊音段断续的特点,根据隐条件随机场区别于隐马尔可夫模型的重要特性——无需对观察值采用统一的建模方式,直接对不连续基频值与连续谱特征观察值一起进行声学建模。大词汇语音库上的汉语带调音节分类实验表明,隐条件随机场下对断续基音频率序列的直接建模较使用清音段人工平滑基频特征的识别率有明显的提高,还给出了与不同区分性准则训练的隐马尔可夫声学模型的实验性能的比较。

【Abstract】 Hidden Conditional Random Fields(HCRFs) based acoustic modeling is proposed by directly using discontinuous fundamental frequency (F0) sequences for Mandarin speech recognition.The method is based on the fact that F0 observations are continuous in voiced portion in Mandarin speech and missing in unvoiced portion,and HCRFs are more suitable for integrating such non-uniform features.Tonal syllable classification tasks are carried out on continuous speech database.Results show HCRFs trained on discontinuous F0 are significantly better than those trained on smooth F0 sequences from artificial interpolation.Comparisons with hidden Markov models under various training criteria are also given.

【基金】 国家自然科学基金 No.60865001;新疆高校科研计划No.XJEDU2008S15~~
  • 【文献出处】 计算机工程与应用 ,Computer Engineering and Applications , 编辑部邮箱 ,2009年30期
  • 【分类号】TN912.34
  • 【被引频次】4
  • 【下载频次】211
节点文献中: 

本文链接的文献网络图示:

本文的引文网络