节点文献

基于规则的HTML文档元数据提取

Metadata Extracting for HTML Document Based on Rules

  • 推荐 CAJ下载
  • PDF下载
  • 不支持迅雷等下载工具,请取消加速工具后下载。

【作者】 狄涤周竞扬潘金贵

【Author】 DI Di, ZHOU Jingyang, PAN Jingui (State Key Laboratory for Novel Software Technology,Department of Computer Science & Technology, Nanjing University,Nanjing 210093)

【机构】 南京大学计算机软件新技术国家重点实验室计算机科学与技术系计算机科学与技术系 南京 210093南京 210093南京 210093

【摘要】 提出了一种基于规则提取HTML文档元数据的方法,介绍了规则的语法、语义和规则库的设计,研制了一个原型系统MEDES(MEtaData Extracting System),实现HTML文档元数据的自动提取。文章的最后给出了实验结果和评价,并指出进一步的工作。

【Abstract】 This paper proposes a metadata extracting method for HTML document based on rules. After introducing syntax and semantics of the rules, design of rule library is discussed. Based on the method aforementioned, a system named MEDES(metadata extracting system) is developed, which can perform automatic metadata extraction from HTML documents. The experiment results are evaluated, and the future work are discussed in the end.

  • 【文献出处】 计算机工程 ,Computer Engineering , 编辑部邮箱 ,2004年09期
  • 【分类号】TP393.09
  • 【被引频次】17
  • 【下载频次】234
节点文献中: 

本文链接的文献网络图示:

本文的引文网络