首页> 中文会议>全国第六届计算语言学联合学术会议 >基于规则和非规则方法的WEB信息提取

基于规则和非规则方法的WEB信息提取

摘要

互联网上的各个信息源是相互独立的.如果一个系统能够把关于某个主题的来自各个信息源的信息集成到一个完全的信息源中,用户就能方便地获得这个主题他(她)所需的最想要的或者全部的信息.该系统中最重要的一个部分就是从网页中提取指定的信息.本文以网上书店为例详细介绍了web页面信息提取的实现.网页中一些信息可以采用基于正则表达式的规则提取,然而也有一类信息很难用规则提取,例如书名.对这些信息,我们采用了基于字体、距离等非语言启发信息的非规则方法提取,试验获得了比较好的结果.以网上书店为例,采用非规则的方法使书名提取的F值提高了31个百分点.

著录项

相似文献

  • 中文文献
  • 外文文献
  • 专利
获取原文

客服邮箱:kefu@zhangqiaokeyan.com

京公网安备:11010802029741号 ICP备案号:京ICP备15016152号-6 六维联合信息科技 (北京) 有限公司©版权所有
  • 客服微信

  • 服务号