当前位置:首页 > 科技  > 软件

如何使用Python中的OCR技术将图像中的文本提取为可编辑文件?

来源: 责编: 时间:2023-09-28 10:07:55 372观看
导读1、安装和配置Pytesseract库Pytesseract是Python的一个OCR库,它是Tesseract OCR引擎的Python封装。在使用Pytesseract之前,需要先安装Tesseract OCR引擎和Pytesseract库。可以使用以下命令在Linux系统中安装Tesseract O

9y028资讯网——每日最新资讯28at.com

1、安装和配置Pytesseract库

Pytesseract是Python的一个OCR库,它是Tesseract OCR引擎的Python封装。在使用Pytesseract之前,需要先安装Tesseract OCR引擎和Pytesseract库。可以使用以下命令在Linux系统中安装Tesseract OCR和Pytesseract库:9y028资讯网——每日最新资讯28at.com

sudo apt-get install tesseract-ocrsudo apt-get install libtesseract-devpip install pytesseract

在Windows系统中,可以从Tesseract OCR的官方网站(https://github.com/UB-Mannheim/tesseract/wiki)下载安装包,然后使用以下命令安装Pytesseract库:9y028资讯网——每日最新资讯28at.com

pip install pytesseract

2、识别图片中的文本

使用Pytesseract库识别图片中的文本非常简单。首先,需要导入pytesseract模块和PIL模块(用于打开和处理图片)。然后,可以使用pytesseract.image_to_string()函数来识别图片中的文本。以下是一个简单的示例:9y028资讯网——每日最新资讯28at.com

import pytesseractfrom PIL import Image# 打开图片img = Image.open('example.png')# 识别图片中的文本text = pytesseract.image_to_string(img, lang='eng')# 打印识别的文本print(text)

在上面的示例中,pytesseract.image_to_string()函数接受两个参数:要识别的图片和语言选项。默认情况下,Pytesseract使用英语语言模型进行识别。如果需要识别其他语言,可以将lang参数设置为对应的语言代码。9y028资讯网——每日最新资讯28at.com

3、整理识别的文本

在将识别的文本整理成word、txt和markdown格式的文件之前,需要先对识别的文本进行处理和清洗,以确保输出的文件格式正确。以下是一些常用的文本处理和清洗操作:9y028资讯网——每日最新资讯28at.com

  • 去除多余的空格和换行符
  • 将文本按照段落进行分割
  • 将文本按照句子进行分割
  • 删除无用的字符和标点符号
  • 将文本转换为小写字母(可选)
  • ...

下面是一个示例代码,将识别的文本整理成txt格式的文件:9y028资讯网——每日最新资讯28at.com

import pytesseractfrom PIL import Image# 打开图片img = Image.open('example.png')# 识别图片中的文本text = pytesseract.image_to_string(img, lang='eng')# 去除多余的空格和换行符text = ' '.join(text.split())text = text.replace('/n', ' ')# 将文本按照段落进行分割paragraphs = text.split('/n/n')# 创建txt文件并写入文本with open('example.txt', 'w') as f:    for p in paragraphs:        f.write(p + '/n/n')

将识别的文本整理成word、markdown格式的文件也类似,只需要将输出格式从txt改为对应的格式,然后使用相应的库或工具来生成文件即可。9y028资讯网——每日最新资讯28at.com

4、完整代码

下面是一个完整的示例代码,将识别的文本整理成word、txt格式的文件:9y028资讯网——每日最新资讯28at.com

import pytesseractfrom PIL import Imageimport docximport os# 打开图片img = Image.open('example.png')# 识别图片中的文本text = pytesseract.image_to_string(img, lang='eng')# 去除多余的空格和换行符text = ' '.join(text.split())text = text.replace('/n', ' ')# 将文本按照段落进行分割paragraphs = text.split('/n/n')# 将文本整理成word格式的文件doc = docx.Document()for p in paragraphs:    doc.add_paragraph(p)doc.save('example.docx')# 将文本整理成txt格式的文件with open('example.txt', 'w') as f:    for p in paragraphs:        f.write(p + '/n/n')# 打开生成的文件os.system('start example.docx')os.system('start example.txt')

在上面的代码中,使用了Python的docx库来生成word格式的文件。在生成文件之后,使用os模块打开文件。在Windows系统中,可以使用os.system()函数来打开文件。在其他操作系统中,可能需要使用其他方式来打开文件。9y028资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-26-11845-0.html如何使用Python中的OCR技术将图像中的文本提取为可编辑文件?

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: SpringBoot 并发编程学习历程,你所需要的所有知识点!

下一篇: 深度使用了下 Serverless,太丝滑了!

标签:
  • 热门焦点
  • 小米降噪蓝牙耳机Necklace分享:听一首歌 读懂一个故事

    在今天下午的小米Civi 2新品发布会上,小米还带来了一款新的降噪蓝牙耳机Necklace,我们也在发布结束的第一时间给大家带来这款耳机的简单分享。现在大家能见到最多的蓝牙耳机
  • Rust中的高吞吐量流处理

    作者 | Noz编译 | 王瑞平本篇文章主要介绍了Rust中流处理的概念、方法和优化。作者不仅介绍了流处理的基本概念以及Rust中常用的流处理库,还使用这些库实现了一个流处理程序
  • JavaScript学习 -AES加密算法

    引言在当今数字化时代,前端应用程序扮演着重要角色,用户的敏感数据经常在前端进行加密和解密操作。然而,这样的操作在网络传输和存储中可能会受到恶意攻击的威胁。为了确保数据
  • JVM优化:实战OutOfMemoryError异常

    一、Java堆溢出堆内存中主要存放对象、数组等,只要不断地创建这些对象,并且保证 GC Roots 到对象之间有可达路径来避免垃 圾收集回收机制清除这些对象,当这些对象所占空间超过
  • 共享单车的故事讲到哪了?

    来源丨海克财经与共享充电宝相差不多,共享单车已很久没有被国内热点新闻关照到了。除了一再涨价和用户直呼用不起了。近日多家媒体再发报道称,成都、天津、郑州等地多个共享单
  • 信通院:小米、华为等11家应用商店基本完成APP签名及验签工作

    中国信通院表示,目前,小米、华为、OPPO、vivo、360手机助手、百度手机助手、应用宝、豌豆荚和努比亚等9家应用商店,以及抖音和快手2家新型应用分发平
  • 华为开发者大会2023日程公开:开设鸿蒙HarmonyOS 4体验区

    IT之家 7 月 31 日消息,华为今日公布了 HDC.Together 开发者大会 2023 的详细日程。整场大会将于 8 月 4 日-6 日之间举行,届时将发布最新一代鸿蒙 H
  • iQOO Neo8 Pro即将开售:到手价3099元起 安卓性能最强旗舰

    5月23日,iQOO如期举行了新品发布会,全新的iQOO Neo8系列也正式与大家见面,包含iQOO Neo8和iQOO Neo8 Pro两个版本,其中标准版搭载高通骁龙8+,而Pro版更
  • OPPO K11搭载长寿版100W超级闪充:26分钟充满100%

    据此前官方宣布,OPPO将于7月25日也就是今天下午14:30举办新品发布会,届时全新的OPPO K11将正式与大家见面,将主打旗舰影像,和同档位竞品相比,其最大的卖
Top