节点文献

基于Alize工具包的广播音频播音员自动标注系统

Anchor labeling system for broadcast news using Alize-toolkit

  • 推荐 CAJ下载
  • PDF下载
  • 不支持迅雷等下载工具,请取消加速工具后下载。

【作者】 卢咪咪谢磊郑李磊杨玉莲张艳宁

【Author】 LU Mimi, XIE Lei, ZHENG Lilei, YANG Yulian, ZHANG Yanning Shaanxi Provincial Key Laboratory of Speech & Image Information Processing, School of Computer Science, Northwestern Polytechnical University, Xi’an 710072, China

【机构】 西北工业大学计算机学院陕西省语音与图像信息处理重点实验室

【摘要】 本文设计与实现了一个基于Alize开源说话人识别工具包的广播音频播音员自动标注系统,对中央电视台《新闻联播》节目主持人以及重要说话人进行自动身份识别、分割与标注。采用Alize工具包提供的Feature Server、Mixture Server和Statistics Server,实现了基于高斯混合模型(GMM)的说话人识别模块。系统引入音频分类、语音分割等模块,音频分类模块对新闻音频中存在的多种音频类型进行区分,仅有被标注为语音的部分被挑选出进行说话人识别和标注。采用一种分层策略进行播音员自动标注,先按身份已知和未知对说话人分类,再对未知说话人进行性别标注。实验表明,该系统的说话人识别错误率低于0.05,对完整《新闻联播》节目的说话人自动标注错误率为0.229。

【Abstract】 This paper proposes an anchor labeling system for broadcast news using Alize toolkit. The system can automatically identify and segment anchors and important speakers in CCTV broadcast news. The speaker recognition module is based on Gaussian mixture models and adopts the feature server, the mixture server and the statistics server provided by Alize. We also introduce an audio classification module and a speech segmentation module as pre-processing steps. The audio classification module ensures that only speech segments are fed into the speaker recognition module. Experimental results show that the average speaker identification error rate of the proposed system is below 0.05. The speaker segmentation error rate on an entire CCTV broadcast news program is 0.229.

【基金】 国家自然科学基金(60802085);教育部新世纪优秀人才支持计划;教育部高等学校博士点学科专项基金(20070699015);陕西省自然科学基础研究计划(2007F15);西北工业大学基础研究基金(W018103);“翱翔之星”资助项目(07XE0150)
  • 【会议录名称】 第18届全国多媒体学术会议(NCMT2009)、第5届全国人机交互学术会议(CHCI2009)、第5届全国普适计算学术会议(PCC2009)论文集
  • 【会议名称】第18届全国多媒体学术会议(NCMT2009)、第5届全国人机交互学术会议(CHCI2009)、第5届全国普适计算学术会议(PCC2009)
  • 【会议时间】2009-10-29
  • 【会议地点】中国陕西西安
  • 【分类号】TP391.42
  • 【主办单位】中国图像图形学会多媒体委员会、中国计算机学会多媒体专业委员会、中国计算机学会普适计算委员会、ACM人机交互学会中国分会
节点文献中: 

本文链接的文献网络图示:

本文的引文网络