首页> 中国专利> 针对多记录网页的记录项抽取系统及方法

针对多记录网页的记录项抽取系统及方法

摘要

本发明涉及一种针对多记录网页的记录项抽取系统及方法,该系统包括:记录树对齐模块,接收已抽取好的记录区域子树,并利用标签信息及语义信息进行树对齐,得到一棵超树,从而让相同语义的节点对应于超树的同一个节点;记录内容抽取模块,使用文本密度及文本密度和度量指标确定记录中记录内容位置;记录项输出模块,将记录区域里所有记录项及其语义标注按照树节点先序遍历输出;反馈框架,在抽取记录项后利用抽取结果检查记录区域定位是否正确,不正确则重新定位记录区域,进而修改记录项抽取结果,正确则直接结束抽取流程。该系统及方法能够高效、准确地对多记录网页中记录区域进行记录项抽取,抽取速度快、准确度高,通用性强,适用范围广。

著录项

  • 公开/公告号CN104217025B

    专利类型发明专利

  • 公开/公告日2018-04-13

    原文格式PDF

  • 申请/专利权人 福州大学;

    申请/专利号CN201410503955.9

  • 发明设计人 陈国龙;廖祥文;陈巧灵;

    申请日2014-09-28

  • 分类号

  • 代理机构福州元创专利商标代理有限公司;

  • 代理人蔡学俊

  • 地址 350108 福建省福州市闽侯县上街镇大学城学园路2号福州大学新区

  • 入库时间 2022-08-23 10:09:33

法律信息

  • 法律状态公告日

    法律状态信息

    法律状态

  • 2018-04-13

    授权

    授权

  • 2015-01-07

    实质审查的生效 IPC(主分类):G06F17/30 申请日:20140928

    实质审查的生效

  • 2014-12-17

    公开

    公开

相似文献

  • 专利
  • 中文文献
  • 外文文献
获取专利

客服邮箱:kefu@zhangqiaokeyan.com

京公网安备:11010802029741号 ICP备案号:京ICP备15016152号-6 六维联合信息科技 (北京) 有限公司©版权所有
  • 客服微信

  • 服务号