一种从网页中抽取评论内容的方法和装置

基本信息

申请号 CN200910244539.0 申请日 -
公开(公告)号 CN102117289B 公开(公告)日 2012-10-10
申请公布号 CN102117289B 申请公布日 2012-10-10
分类号 G06F17/30(2006.01)I 分类 计算;推算;计数;
发明人 刘伟;严华梁;万小军;杨建武;肖建国 申请(专利权)人 北京方正电子政务信息科技有限公司
代理机构 北京同达信恒知识产权代理有限公司 代理人 北京大学;北大方正集团有限公司;北京方正电子政务信息科技有限公司;北京北大方正电子有限公司
地址 100871 北京市海淀区颐和园路5号
法律状态 -

摘要

摘要 本发明公开了一种从网页中抽取评论内容的方法和装置,涉及信息处理技术,通过建立评论页面的DOM树,并选择符合评论区抽取规则的子树抽取出评论区,再利用评论记录间的结构相似性,抽取出评论区中的评论记录,利用包含评论内容的子树的差异性,选择标准差最大的子树作为包含评论内容的子树,最后选取稳定性最小的一条路径中,稳定性差绝对值最大的相邻节点中的孩子节点作为根节点,这个子树就是要抽取的评论内容。由于利用了评论内容的无结构特性来进行抽取,而不是根据网页的模板进行抽取,所以网页的不同不影响抽取的准确性,并且不需要根据网页的模板进行复杂的配置,并通过计算去除了噪声信息,提高了从网页中抽取评论内容的效率和准确性。