基于标注文本的训练数据集生成方法、系统、设备和介质专利查询专利号|摘要-满商公司网

基于标注文本的训练数据集生成方法、系统、设备和介质

基本信息

摘要

摘要	本申请提供了一种基于标注文本的训练数据集生成方法、系统、设备和介质，通过获取多个待标注文本，将各原始长文本拆解为多个拆句短文本并进行去重与清洗处理；处理后存入数据库以分别分配到唯一的数据库id；采用正向最大匹配分句算法在数据库中获取对应的匹配信息；对拆句短文本进行实体/关联标注以分别生成唯一的标注id，并依据各拆句短文本获取其对应的数据库id与标注id的映射关系；根据匹配信息、及映射信息，将拆句短文本拼接为包含实体/关联标注的标注长文本，以供作为训练集数据。本申请能大幅降低企业人工标注的成本，确保重复文本标注一致性，同时能够降低模型算法训练时语料不一致造成的干扰，提升了模型学习的准确率。