python pdfplumber库批量提取pdf表格数据转换为excel

更新时间：2022年06月27日 14:03:54 作者：python与数据分析

这篇文章主要为大家介绍了python使用pdfplumber库批量提取pdf表格数据转换为excel格式的示例详解，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪

需求

想要提取 pdf 的数据，保存到 excel 中。虽然是可以直接利用 WPS 将 pdf 文件输出成 excel，但这个功能是收费的，而且如果将大量pdf转excel的时候，手动去输出是非常耗时的。我们可以利用 python 的三方工具库 pdfplumber 快速完成这个功能。

一、实现效果图

二、pdfplumber 库

pdfplumber 是一个开源 python 工具库-，可以方便地获取 pdf 的各种信息，包括文本、表格、图表、尺寸等。完成我们本文的需求，主要使用 pdfplumber 提取 pdf 表格数据。

安装命令

pip install pdfplumber

三、代码实现

1、导入相关包

import pdfplumber
import pandas as pd

2、读取 pdf , 并获取 pdf 的页数

pdf = pdfplumber.open("/Users/wangwangyuqing/Desktop/1.pdf")
pages = pdf.pages

3、提取单个 pdf 文件，保存成 excel

if len(pages) &gt; 1:
    tables = []
    for each in pages:
        table = each.extract_table()
        tables.extend(table)
else:
    tables = each.extract_table()
data = pd.DataFrame(tables[1:], columns=tables[0])
data
data.to_excel("/Users/wangwangyuqing/Desktop/1.xlsx", index=False)

4、提取文件夹下多个 pdf 文件，保存成 excel

import os
import glob
path = r'/Users/wangwangyuqing/Desktop/pdf文件'
for f in glob.glob(os.path.join(path, "*.pdf")):
    res = save_pdf_to_excel(f)
    print(res)
def save_pdf_to_excel(path):
    #     print('文件名为：',path.split('/')[-1].split('.')[0] + '.xlsx')
    pdf = pdfplumber.open(path)
    pages = pdf.pages
    if len(pages) &gt; 1:
        tables = []
        for each in pages:
            table = each.extract_table()
            tables.extend(table)
    else:
        tables = each.extract_table()
    data = pd.DataFrame(tables[1:], columns=tables[0])
    file_name = path.split('/')[-1].split('.')[0] + '.xlsx'
    data.to_excel("/Users/wangwangyuqing/Desktop/data/{}".format(file_name), index=False)
    return '保存成功！'

小结

python 中还有很多库可以处理 pdf，比如 PyPDF2、pdfminer 等，本文选择pdfplumber 的原因在于能轻松访问有关 PDF 的所有详细信息，包括作者、来源、日期等，并且用于提取文本和表格的方法灵活可定制。大家可以根据手头数据需求，再去解锁 pdfplumber 的更多用法。

以上就是python pdfplumber库批量提取pdf表格数据转换为excel的详细内容，更多关于python pdfplumber库pdf转换excel的资料请关注脚本之家其它相关文章！

您可能感兴趣的文章:

python基础教程之字典操作详解
这篇文章主要介绍了python中的字典操作详解，需要的朋友可以参考下
2014-03-03
python snap7读写PLC的操作方法
这篇文章主要介绍了python snap7读写PLC的操作方法，本文结合实例代码给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值,需要的朋友可以参考下
2023-02-02
python数据结构之图的实现方法
这篇文章主要介绍了python数据结构之图的实现方法,实例分析了Python图的表示方法与常用寻路算法的实现技巧,需要的朋友可以参考下
2015-07-07
python3.7调试的实例方法
在本篇文章里小编给大家整理的是一篇关于python3.7调试的实例方法，需要的朋友可以学习下。
2020-07-07
python爬虫 execjs安装配置及使用
这篇文章主要介绍了python爬虫 execjs安装配置及使用,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2019-07-07
如何使用Python对NetCDF数据做空间相关分析
这篇文章主要介绍了如何使用Python对NetCDF数据做空间相关分析，帮助大家更好的理解和学习使用python，感兴趣的朋友可以了解下
2021-04-04
python计算二维矩形IOU实例
今天就为大家分享一篇python计算二维矩形IOU实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-01-01
在Python中字典根据多项规则排序的方法
今天小编就为大家分享一篇在Python中字典根据多项规则排序的方法，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-01-01
python GUI库图形界面开发之PyQt5图片显示控件QPixmap详细使用方法与实例
这篇文章主要介绍了python GUI库图形界面开发之PyQt5图片显示控件QPixmap详细使用方法与实例,需要的朋友可以参考下
2020-02-02
Python for循环详细讲解(附代码实例)
这篇文章主要给大家介绍了关于Python for循环详细讲解的相关资料,在Python中,for循环是一种常用的控制结构,用于遍历序列(如列表、元组、字符串等)中的元素,需要的朋友可以参考下
2024-03-03