节点文献

基于自然语言理解的个性化Web 数据挖掘系统的设计及实现方法研究

Design and Study of Personalized Web Mining System Based on Natural Language Understanding

【作者】 蔡霞

【导师】 张森;

【作者基本信息】 浙江工业大学 , 计算机应用技术, 2003, 硕士

【摘要】 近年来,随着Internet的迅猛发展,人们越来越习惯于在网上发布信息、查找信息。网络在快捷、方便地带来海量信息的同时,也带来了一堆的问题:由于Web是动态、无结构的,并且页面复杂程度远远超过文本文档,如何从浩如烟海的数据中发现隐藏的有用知识,创造更大的效益是一个迫切需要研究的课题。一般的搜索引擎是基于关键字的查询,命中率较低,且不能针对特定用户给出特定服务。解决这些问题的一个途径,就是将传统的数据挖掘技术和Web结合,进行Web挖掘。而根据用户的特殊要求收集相应的网页并进行分类,采用推式技术,自动地把特定的信息从WWW服务器传输到我们的计算机硬盘上,对于特定的机构、企业、或门户网站收集特定信息具有重要的意义。 数据挖掘出现于20世纪80年代后期,90年代有了突飞猛进的发展。基于Web的挖掘研究起步较晚,最近几年才开始。国内还没有成型的应用系统。 本文提出了一种新的Web挖掘模型——基于自然语言理解的Web挖掘模型,可根据用户的特殊需求定制个性化的Web数据挖掘系统。根据该模型设计了面向新闻挖掘这一特定领域的Web挖掘系统NewsMiner,并对该系统的实现方法做了研究和实验。该方法可方便地扩展到其他专业应用领域。 与传统的Web挖掘系统相比,该系统在以下几个方面有所突破: 1)利用特制的智能网络机器人对几个著名搜索引擎的搜索结果进行挖掘,与普通爬虫从一个链接到另一个链接的无序搜索相比,大大减少了工作量和数据存储空间。 2)无需把所有的目标HTML Page进行代码转换和映射,只需对一些典型句及包含敏感词在内的句子进行语法语义分析,避开了代码映射的一些复杂问题,简单可行。 3)利用自然语言语法语义分析,可以减少传统的简单匹配方法所产生的漏判和误判,提高系统的可靠性。 4)采用人机交互模式,在各个模块都可以适时地进行干预和修正。

【Abstract】 The rapid growth of the World-Wide Web poses unprecedented scaling challenges for general-purpose crawlers and search engines. The combine of data mining and Web is needed to solve the problems.In this paper, a model of Web mining based on Natural Language Understanding is proposed which can customize personalized Web mining system to meet the needs of a particular user. The originality of this model enumerate as follows:1)The mining is based on the results of some popular search engines. This leads to significant savings in hardware and network resources.2)Only the typical sentences and the sentences including keywords need to be semantic analysed.3)The semantic analyse can cut down the mis-judge of the results and can improve the dependability of the system.4)Interaction of Human-Machine is used to interfere and revise in each model.

  • 【分类号】TP311.52
  • 【下载频次】442
节点文献中: 

本文链接的文献网络图示:

本文的引文网络