一种从网页中抽取评论内容的方法和装置
基本信息
申请号 | CN200910244539.0 | 申请日 | - |
公开(公告)号 | CN102117289B | 公开(公告)日 | 2012-10-10 |
申请公布号 | CN102117289B | 申请公布日 | 2012-10-10 |
分类号 | G06F17/30(2006.01)I | 分类 | 计算;推算;计数; |
发明人 | 刘伟;严华梁;万小军;杨建武;肖建国 | 申请(专利权)人 | 北京方正电子政务信息科技有限公司 |
代理机构 | 北京同达信恒知识产权代理有限公司 | 代理人 | 北京大学;北大方正集团有限公司;北京方正电子政务信息科技有限公司;北京北大方正电子有限公司 |
地址 | 100871 北京市海淀区颐和园路5号 | ||
法律状态 | - |
摘要
摘要 | 本发明公开了一种从网页中抽取评论内容的方法和装置,涉及信息处理技术,通过建立评论页面的DOM树,并选择符合评论区抽取规则的子树抽取出评论区,再利用评论记录间的结构相似性,抽取出评论区中的评论记录,利用包含评论内容的子树的差异性,选择标准差最大的子树作为包含评论内容的子树,最后选取稳定性最小的一条路径中,稳定性差绝对值最大的相邻节点中的孩子节点作为根节点,这个子树就是要抽取的评论内容。由于利用了评论内容的无结构特性来进行抽取,而不是根据网页的模板进行抽取,所以网页的不同不影响抽取的准确性,并且不需要根据网页的模板进行复杂的配置,并通过计算去除了噪声信息,提高了从网页中抽取评论内容的效率和准确性。 |
