基于标注文本的训练数据集生成方法、系统、设备和介质
基本信息
申请号 | CN202010622293.2 | 申请日 | - |
公开(公告)号 | CN111859857B | 公开(公告)日 | 2021-08-27 |
申请公布号 | CN111859857B | 申请公布日 | 2021-08-27 |
分类号 | G06F40/117;G06F40/232;G06F40/279;G06F40/295 | 分类 | 计算;推算;计数; |
发明人 | 张少典;顾根;刘霄晨 | 申请(专利权)人 | 上海森亿医疗科技有限公司 |
代理机构 | 上海光华专利事务所(普通合伙) | 代理人 | 李治东 |
地址 | 201213上海市浦东新区亮景路232号501、502室 | ||
法律状态 | - |
摘要
摘要 | 本申请提供了一种基于标注文本的训练数据集生成方法、系统、设备和介质,通过获取多个待标注文本,将各原始长文本拆解为多个拆句短文本并进行去重与清洗处理;处理后存入数据库以分别分配到唯一的数据库id;采用正向最大匹配分句算法在数据库中获取对应的匹配信息;对拆句短文本进行实体/关联标注以分别生成唯一的标注id,并依据各拆句短文本获取其对应的数据库id与标注id的映射关系;根据匹配信息、及映射信息,将拆句短文本拼接为包含实体/关联标注的标注长文本,以供作为训练集数据。本申请能大幅降低企业人工标注的成本,确保重复文本标注一致性,同时能够降低模型算法训练时语料不一致造成的干扰,提升了模型学习的准确率。 |
