节点文献
基于WordNet的中泰文跨语言文本相似度计算
Chinese-Thai Cross-language Text Similarity Computing Based on WordNet
【摘要】 文本相似度在信息检索、文本挖掘、抄袭检测等领域有着广泛的应用。目前,大多数研究都只是针对同一种语言的文本相似度计算,关于跨语言文本相似度计算的研究则很少,不同语言之间的差异使得跨语言文本相似度计算很困难,针对这种情况,该文提出一种基于WordNet的中泰文跨语言文本相似度的计算方法。首先对中泰文本进行预处理和特征选择,然后利用语义词典WordNet将中泰文本转换成中间层语言,最后在中间层上计算中泰文本的相似度。实验结果表明,该方法准确率达到82%。
【Abstract】 Text similarity calculation is widely used by information retrieval,question answering system,plagiarism detection and so on.At present,most research just aim at text similarity of the same language,and research on cross-language text similarity calculation remains an open issue.This paper propose a WordNet-based method of Chinese-Thai cross-language text similarity calculation.We apply the semantic dictionary WordNet to convert the Chinese text and Thai text into a middle layer language,and compute the text similarity between Chinese and Thai in the middle layer.Experimental results show that,this paper’s method of computing the similarity between Chinese text and Thai text has 82%’s accuracy.
【Key words】 WordNet; middle layer language; cross-language text similarity;
- 【文献出处】 中文信息学报 ,Journal of Chinese Information Processing , 编辑部邮箱 ,2016年04期
- 【分类号】TP391.1
- 【被引频次】16
- 【下载频次】270