基于标注文本的训练数据集生成方法、系统、设备和介质

基本信息

申请号 CN202010622293.2 申请日 -
公开(公告)号 CN111859857B 公开(公告)日 2021-08-27
申请公布号 CN111859857B 申请公布日 2021-08-27
分类号 G06F40/117;G06F40/232;G06F40/279;G06F40/295 分类 计算;推算;计数;
发明人 张少典;顾根;刘霄晨 申请(专利权)人 上海森亿医疗科技有限公司
代理机构 上海光华专利事务所(普通合伙) 代理人 李治东
地址 201213上海市浦东新区亮景路232号501、502室
法律状态 -

摘要

摘要 本申请提供了一种基于标注文本的训练数据集生成方法、系统、设备和介质,通过获取多个待标注文本,将各原始长文本拆解为多个拆句短文本并进行去重与清洗处理;处理后存入数据库以分别分配到唯一的数据库id;采用正向最大匹配分句算法在数据库中获取对应的匹配信息;对拆句短文本进行实体/关联标注以分别生成唯一的标注id,并依据各拆句短文本获取其对应的数据库id与标注id的映射关系;根据匹配信息、及映射信息,将拆句短文本拼接为包含实体/关联标注的标注长文本,以供作为训练集数据。本申请能大幅降低企业人工标注的成本,确保重复文本标注一致性,同时能够降低模型算法训练时语料不一致造成的干扰,提升了模型学习的准确率。