本申请涉及文本识别技术领域,具体涉及一种文本识别方法和文本识别装置,以及计算机可读存储介质和电子设备,解决了文本识别不准确和效率低的问题。该文本识别方法,通过使多个字符串中相邻的字符串有部分重叠,从而可以使多个字符串体现待识别文本的上下文之间的关系。然后,对多个字符串进行词向量转化,得到多个词向量,基于多个词向量生成多个词向量各自对应的词向量识别结果,以确定词向量对应的文本是功效文本还是非功效文本,综合多个词向量识别结果来确定待识别文本的文本识别结果,识别到了待识别文本的上下文之间的关系,提高了文本识别的准确性。另外,本申请的文本识别方法不需要人工标引,提高了文本识别的效率。
背景技术
专利文献主要包括技术问题、技术方案和技术功效三个部分。根据专利文献的技术功效部分可以对专利文献进行详细的分类。
目前,有利用专利的著录项目信息来识别功效文本,从而对专利文件进行分类的方法。但是专利的著录项目信息过于宽泛,不能准确的识别出功效文本,无法对专利文献进行详细的分类。现有技术中,为了提高识别功效文本的准确度,主要通过规则标引或人工标引的方式来确定功效文本。规则标引是通过识别具体的语法模式来确定功效文本,容易遗漏语法模式无法覆盖的其他表达,从而可能遗漏重要的专利信息,导致文本识别的准确性较低。人工标引虽然准确性较高,但是需要耗费大量的人力,导致文本识别的效率较低。
实现思路