中国学术期刊网络出版总库
  关闭
基于位置标签与词性结合的组合词抽取方法  
   推荐 CAJ下载 PDF下载
【英文篇名】 Compound word extraction based on location tag and POS
【下载频次】 ★★★☆
【作者】 欧阳柳波; 周伟光;
【英文作者】 Ouyang Liubo; Zhou Weiguang; College of Computer Science & Electronic Engineering; Hunan University;
【作者单位】 湖南大学信息科学与工程学院;
【文献出处】 计算机应用研究 , Application Research of Computers, 编辑部邮箱 2016年 04期  
期刊荣誉:中文核心期刊要目总览  ASPT来源刊  中国期刊方阵  CJFD收录刊
【中文关键词】 组合词抽取; 位置标签集; 相邻度; 反规则过滤; 新词发现;
【英文关键词】 compound word extraction; location tag set; adjacent degree; reverse rule filtering; new words detecting;
【摘要】 现有分词系统不能及时收录新词语,因而不能有效识别领域组合词。针对此问题,提出一种位置标签与词性相结合的组合词抽取方法。首先对语料进行文本预处理、添加位置标签、加权词频过滤等建立词条的位置标签集;然后依据位置标签集计算词条在句子中的相邻度判定组合词;最后制定反规则对抽取结果进行过滤,并对垃圾串进行两端逐步消减再判定进一步识别组合词。通过在不同语料库上进行实验,结果表明本方法具有更高的准确率。
【英文摘要】 Now existing segmentation systems cannot recruit new words timely,so they cannot identify compound words effectively. To solve that,this paper proposed a method of compound word extraction based on location tag and POS( part of speech). First,this method established location tag set for each item by processing corpus texts,adding location tag for each item and filtering items with weighted term frequency. Then it counted adjacent degree to judge compound words on the basis of location tag set. Finally,formu...
【基金】 国家自然科学基金资助项目(61472132); 湖南省产学研结合重大科技成果转化资助项目(2010XK6024); 国家核高基重大专项资助项目(2012ZX01045-004-005-002)
【更新日期】 2016-04-21
【分类号】 TP391.1
【正文快照】 汉语自动分词是中文信息处理的一项基础性工作,但其重要性不言而喻。随着社会的发展、科技的进步,人类的知识越来越丰富,越来越多的组合词不断出现用来表达新概念,如“移动互联网”“数据挖掘”“软件开发过程”等。传统分词系统不能及时把它们收录进词库,无法有效识别它们,而?

xxx
【读者推荐文章】中国期刊全文数据库
【相似文献】
中国期刊全文数据库
中国优秀硕士学位论文全文数据库
中国博士学位论文全文数据库
中国重要会议论文全文数据库
中国重要报纸全文数据库
中国学术期刊网络出版总库
点击下列相关研究机构和相关文献作者,可以直接查到这些机构和作者被《中国知识资源总库》收录的其它文献,使您全面了解该机构和该作者的研究动态和历史。
【文献分类导航】从导航的最底层可以看到与本文研究领域相同的文献,从上层导航可以浏览更多相关领域的文献。

工业技术
  自动化技术、计算机技术
   计算技术、计算机技术
    计算机的应用
     信息处理(信息加工)
      文字信息处理
  
 
  CNKI系列数据库编辑出版及版权所有:中国学术期刊(光盘版)电子杂志社
中国知网技术服务及网站系统软件版权所有:清华同方知网(北京)技术有限公司
其它数据库版权所有:各数据库编辑出版单位(见各库版权信息)
京ICP证040431号    互联网出版许可证 新出网证(京)字008号