节点文献

一种基于改进的最大熵模型的汉语词性自动标注的新方法

A Chinese Part-of-Speech Based on Improved Maximum Entropy Model

  • 推荐 CAJ下载
  • PDF下载
  • 不支持迅雷等下载工具,请取消加速工具后下载。

【作者】 赵伟赵法兴王东海韩达奇

【Author】 Zhao Wei~(1,2),Zhao Faxing~2,Wang Donghai~2,and Han Daqi~2 1(College of Computer Science and Technology,Jilin University,Changchun 130012) 2(School of Computer Sciences & Engineering,Changchun University of Technology,Changchun 130012)

【机构】 吉林大学计算机科学与技术学院长春工业大学计算机科学与工程学院

【摘要】 最大熵模型已成为自然语言处理领域中的研究热点,但由于熟语料库规模的限制,模型参数会出现稀疏现象,影响了模型的精确度.另外最大熵模型参数众多、计算量大,一个好的参数估计算法将会有效地提高模型的效率.实验证明,采用BLMVM算法的基于Gaussian prior平滑技术的最大熵模型具有出色的表现.基于以上认识,结合汉语自身的特点,设计了一个基于词和字特征的汉语词性自动标注系统,取得了较好的标注效果.

【Abstract】 With its many virtues,maximum entropy model has been favored in natural language processing.But unfortunately,there is not enough tagged corpus to train it,what can be obtained is a model with sparse parameters.In order to overcome this problem,a Gaussian prior smoothing is performed to the ME model.Based on this smoothing ME model and characteristic of Chinese,a new Chinese POS system is presented.The result of experiment shows that it works well.

【基金】 吉林省科技条件平台建设基金项目(20030340)
  • 【会议录名称】 第二十三届中国数据库学术会议论文集(研究报告篇)
  • 【会议名称】第二十三届中国数据库学术会议
  • 【会议时间】2006-11-10
  • 【会议地点】中国广东广州
  • 【分类号】TP391.1
  • 【主办单位】中国计算机学会数据库专业委员会
节点文献中: 

本文链接的文献网络图示:

本文的引文网络