当前位置:首页 > 科技  > 软件

用Python替代Adobe,零成本从PDF提取数据

来源: 责编: 时间:2023-11-28 09:34:28 154观看
导读一、简介PDF文件是官方报告、发票和数据表的通用语言,然而从PDF文件中提取表格数据可能是一项挑战。尽管Adobe Acrobat等工具提供了解决方案,但它们并不总是易于获取或可自动化运行,而Python则是编程语言中的瑞士军刀。

一、简介

PDF文件是官方报告、发票和数据表的通用语言,然而从PDF文件中提取表格数据可能是一项挑战。尽管Adobe Acrobat等工具提供了解决方案,但它们并不总是易于获取或可自动化运行,而Python则是编程语言中的瑞士军刀。本文将探讨如何利用Python轻松实现PDF数据提取,而无需使用昂贵的软件。aPn28资讯网——每日最新资讯28at.com

二、了解挑战

PDF文件是为展示而设计的,而不是为提取数据。它们通常包含复杂的布局,在视觉上很吸引人,但在计算上却无法访问。因此,提取表格等结构化信息非常困难。aPn28资讯网——每日最新资讯28at.com

三、使用PyMuPDF提取文本

PyMuPDF是一款轻量级的库,擅长读取PDF文件并提取文本。只需几行代码,就可以读取PDF并从任意页面提取文本。本文从奔驰集团2022年第四季度年度报告中提取“股东权益变动综合报表(Consolidated Statement of Changes in Equity)”,代码如下。aPn28资讯网——每日最新资讯28at.com

import fitz  import pandas as pdimport re# --- PDF处理 ---# 定义PDF文件的路径并打开文档pdf_path = '..../Merc 2022Q4 Rep.pdf'pdf_document = fitz.open(pdf_path)# 选择要阅读的特定页面page = pdf_document[200]# 获取页面的尺寸page_rect = page.rectpage_width, page_height = page_rect.width, page_rect.height# 定义感兴趣区域的矩形(不包括脚注)non_footnote_area_height = page_height * 0.90clip_rect = fitz.Rect(0, 0, page_width, non_footnote_area_height)# 从定义的区域提取文本page_text = page.get_text("text", clip=clip_rect)lines_page = page_text.strip().split('/n')

四、规整数据

提取的文本通常带有不需要的字符或格式。这就是预处理发挥作用的地方。Python的字符串处理功能使用户能够清洗和准备数据以转换为表格格式。aPn28资讯网——每日最新资讯28at.com

# --- 数据清洗 ---# 定义要搜索的字符串并查找其索引search_string = 'Balance at 1 January 2021 (restated) 'try:    index = lines_page.index(search_string)    data_lines = lines_page[index:]except ValueError:    print(f"The string '{search_string}' is not in the list.")    data_lines = []# 如果不是数字或连字符,则合并连续字符串条目def combine_consecutive_strings(lines):    combined = []    buffer = ''        for line in lines:        if isinstance(line, str) and not re.match(r'^[-/d,.]+$', line.strip()):            buffer += ' ' + line if buffer else line        else:            if buffer:                combined.append(buffer)                buffer = ''            combined.append(line.strip())        if buffer:        combined.append(buffer)        return combinedcleaned_data = combine_consecutive_strings(data_lines)

五、使用Pandas创建表格

一旦数据清洗完成,就可以使用pandas了。这个功能强大的数据分析库可以将一系列数据点转换为DataFrame,即一个二维的、大小可变的、可能是异构的带有标记轴的表格数据结构。aPn28资讯网——每日最新资讯28at.com

# --- 创建DataFrame ---# 根据列数将清洗后的数据分割成块num_columns = 6data_chunks = [cleaned_data[i:i + num_columns] for i in range(0, len(cleaned_data), num_columns)]# 定义DataFrame的表头headers = [    'Description',    'Share capital',    'Capital reserves',    'Retained earnings (restated)',    'Currency translation (restated)',    'Equity instruments / Debt instruments']# 使用数据块和表头创建DataFramefinancial_df = pd.DataFrame(data_chunks, columns=headers)# Display the head of the DataFrame to verify its structurefinancial_df.head()

如下所示是从PDF文件中提取的表格结果。aPn28资讯网——每日最新资讯28at.com

图片图片aPn28资讯网——每日最新资讯28at.com

六、结语

通过利用Python强大的库,可以自动化繁琐的PDF数据提取任务。这种方法不仅成本低,而且提供了Python开发者所喜爱的灵活性和强大功能。aPn28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-26-34615-0.html用Python替代Adobe,零成本从PDF提取数据

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 秒杀系统 Go 并发编程实践!

下一篇: 层次分析法--可以帮助你做决策的简单算法

标签:
  • 热门焦点
  • 对标苹果的灵动岛 华为带来实况窗功能

    对标苹果的灵动岛 华为带来实况窗功能

    继苹果的灵动岛之后,华为也在今天正式推出了“实况窗”功能。据今天鸿蒙OS 4.0的现场演示显示,华为的实况窗可以更高效的展现出实时通知,比如锁屏上就能看到外卖、打车、银行
  • 十个可以手动编写的 JavaScript 数组 API

    十个可以手动编写的 JavaScript 数组 API

    JavaScript 中有很多API,使用得当,会很方便,省力不少。 你知道它的原理吗? 今天这篇文章,我们将对它们进行一次小总结。现在开始吧。1.forEach()forEach()用于遍历数组接收一参
  • 分布式系统中的CAP理论,面试必问,你理解了嘛?

    分布式系统中的CAP理论,面试必问,你理解了嘛?

    对于刚刚接触分布式系统的小伙伴们来说,一提起分布式系统,就感觉高大上,深不可测。而且看了很多书和视频还是一脸懵逼。这篇文章主要使用大白话的方式,带你理解一下分布式系统
  • 三万字盘点 Spring 九大核心基础功能

    三万字盘点 Spring 九大核心基础功能

    大家好,我是三友~~今天来跟大家聊一聊Spring的9大核心基础功能。话不多说,先上目录:图片友情提示,本文过长,建议收藏,嘿嘿嘿!一、资源管理资源管理是Spring的一个核心的基础功能,不
  • 19个 JavaScript 单行代码技巧,让你看起来像个专业人士

    19个 JavaScript 单行代码技巧,让你看起来像个专业人士

    今天这篇文章跟大家分享18个JS单行代码,你只需花几分钟时间,即可帮助您了解一些您可能不知道的 JS 知识,如果您已经知道了,就当作复习一下,古人云,温故而知新嘛。现在,我们就开始今
  • .NET 程序的 GDI 句柄泄露的再反思

    .NET 程序的 GDI 句柄泄露的再反思

    一、背景1. 讲故事上个月我写过一篇 如何洞察 C# 程序的 GDI 句柄泄露 文章,当时用的是 GDIView + WinDbg 把问题搞定,前者用来定位泄露资源,后者用来定位泄露代码,后面有朋友反
  • 品牌洞察丨服务本地,美团直播成效几何?

    品牌洞察丨服务本地,美团直播成效几何?

    来源:17PR7月11日,美团App首页推荐位出现“美团直播”的固定入口。在直播聚合页面,外卖“神枪手”直播间、美团旅行直播间、美团买菜直播间等均已上线,同时
  • 消息称小米汽车开始筛选交付中心:需至少120个车位

    消息称小米汽车开始筛选交付中心:需至少120个车位

    IT之家 7 月 7 日消息,日前,有微博简介为“汽车行业从业者、长三角一体化拥护者”的微博用户 @长三角行健者 发文表示,据经销商集团反馈,小米汽车目前
  • 2299元起!iQOO Pad开启预售:性能最强天玑平板

    2299元起!iQOO Pad开启预售:性能最强天玑平板

    5月23日,iQOO如期举行了新品发布会,除了首发安卓最强旗舰处理器的iQOO Neo8系列新机外,还在发布会上推出了旗下首款平板电脑——iQOO Pad,其搭载了天玑
Top