节点文献

基于Tri-training与噪声过滤的弱监督关系抽取

Weakly Supervised Relation Extraction Based on Tri-training and Noise Filtering

  • 推荐 CAJ下载
  • PDF下载
  • 不支持迅雷等下载工具,请取消加速工具后下载。

【作者】 贾真冶忠林尹红风何大可

【Author】 JIA Zhen;YE Zhonglin;YIN Hongfeng;HE Dake;School of Information and Science Technology,Southwest Jiaotong University;DOCOMO Innovations Inc.;

【机构】 西南交通大学信息科学与技术学院DOCOMO Innovations公司

【摘要】 弱监督关系抽取利用已有关系实体对从文本集中自动获取训练数据,有效解决了训练数据不足的问题。针对弱监督训练数据存在噪声、特征不足和不平衡,导致关系抽取性能不高的问题,文中提出NF-Tri-training(Tritraining with Noise Filtering)弱监督关系抽取算法。它利用欠采样解决样本不平衡问题,基于Tri-training从未标注数据中迭代学习新的样本,提高分类器的泛化能力,采用数据编辑技术识别并移除初始训练数据和每次迭代产生的错标样本。在互动百科采集数据集上实验结果表明NF-Tri-training算法能够有效提升关系分类器的性能。

【Abstract】 Weakly supervised relation extraction utilizes entity pairs to obtain training data from texts automatically,which can effectively deal with the problem of inadequate training data.However,there are many problems in the weakly supervised training data such as noise,inadequate features,and imbalance samples,leading to low performance of relation extraction.In this paper,a weakly supervised relation extraction algorithm named NF-Tri-training(Tri-training with Noise Filtering)is proposed.NF-Tri-training employs an under-sampling approach to solve the problem of imbalance samples,learns new samples iteratively from unlabeled data and uses a data editing technique to identify and discard possible mislabeled samples both in initial training data and in new samples generating at each iteration.The experiment on dataset of Hudong encyclopedia indicates the proposed method can improve the performance of relation classifiers.

【基金】 国家自然科学基金(61170111,61202043,61262058)
  • 【文献出处】 中文信息学报 ,Journal of Chinese Information Processing , 编辑部邮箱 ,2016年04期
  • 【分类号】TP391.1
  • 【被引频次】6
  • 【下载频次】175
节点文献中: 

本文链接的文献网络图示:

本文的引文网络