一种基于主题词语义相似度的话题聚类方法
基本信息
申请号 | CN202011576986.9 | 申请日 | - |
公开(公告)号 | CN114691861A | 公开(公告)日 | 2022-07-01 |
申请公布号 | CN114691861A | 申请公布日 | 2022-07-01 |
分类号 | G06F16/35(2019.01)I;G06F40/194(2020.01)I;G06F40/289(2020.01)I;G06F40/30(2020.01)I | 分类 | 计算;推算;计数; |
发明人 | 姜卫平;白冰;赵崟江;郭忠武;冯慧 | 申请(专利权)人 | 北京市博汇科技股份有限公司 |
代理机构 | 北京弘权知识产权代理有限公司 | 代理人 | - |
地址 | 100094北京市海淀区永丰产业基地丰贤中路7号孵化楼B座501 | ||
法律状态 | - |
摘要
摘要 | 本申请公开了一种基于主题词语义相似度的话题聚类方法,该方法对每个原始标题进行预处理,获取待聚类标题集合,然后提取目标待聚类标题对应的多个主题词,根据预设的排除词集合及每个待聚类标题对应的多个主题词,生成主题集合,对主题集合中的任一主题对象进行文本数字化处理,获取主题向量化集合,针对目标主题向量化对象,从主题向量化集合中筛选出相似的主题向量化对象,并将目标主题向量化对象与相似的主题向量化对象作为同种话题实现聚类。上述方法在针对大量网络文本数据时,不需要指定K值,通过提取主题词,然后计算相似度,便可以实现话题聚类,且能够保证聚类的主题相似,话题相近,具有覆盖范围大,计算复杂度低的优点。 |
