节点文献

利用深度神经网络实现汉藏双语语音合成

Using deep neural network to realize a Mandarin-Tibetan bilingual speech synthesis

  • 推荐 CAJ下载
  • PDF下载
  • 不支持迅雷等下载工具,请取消加速工具后下载。

【作者】 吴沛文杨鸿武甘振业

【Author】 WU Peiwen;YANG Hongwu;GAN Zhenye;College of Physics and Electronic Engineering,Northwest Normal University;

【机构】 西北师范大学物理与电子工程学院

【摘要】 本文提出了一种基于深度神经网络(Deep Neural Network,DNN)的汉藏语双语语音合成方法。该方法以普通话和藏语的声韵母作为语音合成基元,利用普通话和藏语的不同说话人的训练语料,训练合成基元的DNN声学模型。在语音合成时,利用文本分析获得藏语或普通话文本中合成基元的上下文相关信息,进而利用训练好的DNN声学模型产生语音参数,合成出藏语或普通话语音。主客观实验表明,本文方法合成的藏语语音音质优于基于HMM的汉藏双语跨语言语音合成的藏语语音,也优于仅使用藏语训练语料训练的DNN模型合成的藏语语音。该方法能够应用于语音资源稀少的民族语言的语音合成。

【Abstract】 The paper realizes a deep neural network(DNN)-based Mandarin-Tibetan bilingual speech synthesis.We select initials and finals as speech synthesis units to train a set of DNN-based acoustic models for each speech synthesis units with a Mandarin speaker’s corpus and a Tibetan speaker’s corpus.The Tibetan or Mandarin speech is synthesized by speech parameters that are generated from trained DNN acoustic models with context-dependent information of each speech synthesis unit obtained from Tibetan or Mandarin sentence.Subjective and objective tests show that synthesized Tibetan speech by the proposed method is not only better than the hidden Markov model(HMM)-based Mandarin/Tibetan cross-lingual speech synthesis but also better than the DNN-based Tibetan speech synthesis that only uses Tibetan training corpus.Therefore the proposed method can be used for minority language speech synthesis that lacks speech resources.

【基金】 国家自然科学基金项目(11664036,61263036);甘肃自然科学基金项目(1506RJYA126)
  • 【会议录名称】 第十四届全国人机语音通讯学术会议(NCMMSC’2017)论文集
  • 【会议名称】第十四届全国人机语音通讯学术会议
  • 【会议时间】2017-10-11
  • 【会议地点】中国江苏连云港
  • 【分类号】TN912.33
  • 【主办单位】中国中文信息学会语音信息专业委员会
节点文献中: