一种数据去重的方法及装置
基本信息
申请号 | CN201410811756.4 | 申请日 | - |
公开(公告)号 | CN104462527A | 公开(公告)日 | 2015-03-25 |
申请公布号 | CN104462527A | 申请公布日 | 2015-03-25 |
分类号 | G06F17/30(2006.01)I | 分类 | 计算;推算;计数; |
发明人 | 马欣;顾喜德 | 申请(专利权)人 | 龙信数据(北京)有限公司 |
代理机构 | 北京集佳知识产权代理有限公司 | 代理人 | 龙信数据(北京)有限公司 |
地址 | 100097 北京市海淀区蓝靛厂东路2号金源时代商务中心B座3D | ||
法律状态 | - |
摘要
摘要 | 本发明公开了一种数据去重的方法及装置,该方法包括:获取待处理的数据的业务主键,所述业务主键为根据业务需求代表数据唯一性的字段;将所述业务主键转换为统一的预设格式,生成匹配码;按预设的顺序对所述生成的匹配码进行排序,生成验证码;查找所述经排序后的验证码,将所述验证码与排列在前的第一验证码进行比对,当所述验证码与所述第一验证码相同时,将所述验证码的区分码记为第二区分码;删除所述验证码中标记为第二区分码的数据。在对多行或者多列且数据规模在千万级以上的数据进行处理时,该去重方法配置简单、使用方便、可操作性强,并且能够实现多行或多列的同时去重处理,节省了大量的处理时间,提高了去重处理的效率。 |
