|
|
|
|
【英文篇名】 |
Fcoused crawler bused on Bayesian classifier |
|
【下载频次】 |
★★★ |
|
【作者】 |
贾海军;
陈海光; |
|
【英文作者】 |
JIA Haijun;
CHEN Haiguang;
College of Information;
Mechanical and Electrical Engineering;
Shanghai Normal University; |
|
【作者单位】 |
上海师范大学信息与机电工程学院; |
|
【文献出处】 |
上海师范大学学报(自然科学版)
, Journal of Shanghai Normal University(Natural Sciences), 编辑部邮箱
2013年 06期 期刊荣誉:ASPT来源刊 CJFD收录刊 |
|
【中文关键词】 |
主题爬虫;
贝叶斯分类器;
网页相关性; |
|
【英文关键词】 |
focused crawler;
Bayesian classifier;
relevance of web pages; |
|
【摘要】 |
随着网络的高速发展,其信息资源越来越庞大,面对巨量的信息库,搜索引擎起着重要的作用.主题爬虫技术作为搜索引擎的主要核心部分,计算搜索结果与搜索主题的关系,该关系被称为相关性.一般主题爬虫方法只计算网页内容与搜索主题的相关性,作者所提主题爬虫,通过链接内容和锚文本内容计算链接的重要性,然后利用贝叶斯分类器对链接进行分类,最后利用余弦相似函数计算网页的相关性,如果相关值大于阀值,则认为该网页与预定主题相关,否则不相关.实验结果证明:所提出主题爬虫方法可以获得很高的精确度. |
|
【英文摘要】 |
With the rapid development of the network,its information resources are increasingly large and faced a huge amount of information database,search engine plays an important role. Focused crawling technique,as the main core portion of search engine,is used to calculate the relationship between search results and search topics,which is called correlation. Normally,focused crawling method is used only to calculate the correlation between web content and search related topics. In this paper,focused crawling meth... |
|
【更新日期】 |
2014-04-22 |
|
【分类号】 |
TP391.3 |
|
【正文快照】 |
0引言网络爬虫[1]是采取一定的策略,自动的抓取网页信息的计算机程序,其原理是从一个或若干初始网页的链接开始,获得初始网页中的链接,逐个抓取其他的网页,网页通过超链接相互连接,组成了一个庞大、无形的网络,网络爬虫就像一只蜘蛛一样在这个网络中爬来爬去,所以网络爬虫又称? |
|
| 【相似文献】 |
 |
中国期刊全文数据库 |
 |
|
 |
中国优秀硕士学位论文全文数据库 |
 |
|
 |
中国博士学位论文全文数据库 |
 |
|
 |
中国重要会议论文全文数据库 |
 |
|
 |
中国重要报纸全文数据库 |
 |
|
 |
中国学术期刊网络出版总库 |
 |
|
|
|
点击下列相关研究机构和相关文献作者,可以直接查到这些机构和作者被《中国知识资源总库》收录的其它文献,使您全面了解该机构和该作者的研究动态和历史。
|
|
【文献分类导航】从导航的最底层可以看到与本文研究领域相同的文献,从上层导航可以浏览更多相关领域的文献。
|
|
|