一种版面信息识别的方法及装置

基本信息

申请号 CN201010193898.0 申请日 -
公开(公告)号 CN102262618B 公开(公告)日 2014-07-09
申请公布号 CN102262618B 申请公布日 2014-07-09
分类号 G06F17/22(2006.01)I;G06F17/27(2006.01)I 分类 计算;推算;计数;
发明人 高良才;汤帜;房婧;仇睿恒 申请(专利权)人 北京北大方正技术研究院有限公司
代理机构 北京天昊联合知识产权代理有限公司 代理人 北京大学;北大方正集团有限公司;北京北大方正技术研究院有限公司
地址 100871 北京市海淀区颐和园路5号
法律状态 -

摘要

摘要 本发明提供一种版面信息识别方法,包括:读取待识别版面,分离字符文本对象与图像对象,合并文本块,将图像对象保留为图像块;从合并的文本块中识别出图注文本块;利用优化方法对图像块和图注文本块进行最优匹配,从而获得相关联的图像块与图注文本块;从所述版面的文本块中去掉图注文本块,并确定其余文本块和图像块的阅读顺序;在阅读顺序中将图注文本块插回到相关联的图像块之后。相应地,本发明提供一种版面信息识别装置。本发明将版面上的全部图像和图注综合考虑,通过最优匹配方法获得图像与图注的全局最优匹配,不受图像与图注数目以及它们之间空间样式的限制,能够从全局上找到最优的关联关系,从而改进现有的版面阅读顺序识别效果。