Python自动化办公之Word文件内容的读取

更新时间：2022年05月11日 09:05:40 作者：渴望力量的哈士奇

word、excel、PPT，虽然说是特殊文件，其实也是实际工作中我们经常会用到的文件类型。本文将为大家详解Python读取Word文件和文件内容的方法，感兴趣的可以了解一下

前言

前面几个章节我们学习了对于普通文件的操作，比如说文件的创建、复制粘贴、裁剪粘贴、文件名的重命名、删除等等。另外还学习了一些基本练习，如何查找文件、如何按照内容查找文件等等。

在本章节及后续，将开始学习一些特殊文件的自动化相关操作。如 word、excel、PPT，虽然说是特殊文件，其实也是实际工作中我们经常会用到的文件类型。

接下来我们就进入到 word 文件自动化操作的学习内容。

该章节涉及的新模块

python-docx

pdfkit

pydocx

利用 python 批量读取文件

word利器之python-docx

python-docx 是用于创建可修改微软 Word 的一个 python 库，提供全套的 Word 操作，是最常用的 Word 工具。

使用前，先了解几个概念：

Document：是一个 Word 文档对象，不同于 VBA 中 Worksheet 的概念，Document 是独立的，打开不同的 Word 文档，就会有不同的 Document 对象，相互之间没有影响
Paragraph：是段落，一个 Word 文档由多个段落组成，当在文档中输入一个回车键，就会成为新的段落，输入 shift + 回车，不会分段
Run 表示一个节段，每个段落由多个节段组成，一个段落中具有相同样式的连续文本，组成一个节段，所以一个段落对象有个 Run 列表。

例如下图的 word 文档示意图：

word 文档结构划分如下：

python-docx 安装

安装：

pip install python-docx 如果安装速度太慢的话，可以换一个国内的源地址（如下）

pip install -i https://pypi.tuna.tsinghua.edu.cn/simple python-docx

导入：

import docx
from docx import …

python-docx 之 Document

导入包与模块：

from docx import Document

使用方法：

Document(word文件地址)

返回值：

word文件对象

python-docx 之段落内容读取

实际上要想读取一个 word 文档，主要就是读取它的段落以及它的表格。无论是段落还是表格，它的内部都是字符串，我们的目的就是读取这些字符串的内容。

先看一下段落内容的读取方式：

来源：

document_obj.paragraphs 通过 document 对象的 paragraphs 函数返回一个段落的列表；如果 word 文件存在多个段落，就会有多个段落对象。

使用方法：

通过循环获取每个段落对象，并调用 text

演示案例脚本如下：

# coding:utf-8

import os
from docx import Document

path = os.path.join(os.getcwd(), 'test_file/文本.docx')
print("\'文本.docx\' 的路径为：", path)     # 调试路径

doc = Document(path)

for p in doc.paragraphs:
    print(p.text)

运行结果如下：（PS：文本只是演示，本人非培训机构的！）

python-docx 之表格内容读取

接下来我们看一下如何读取 word 文件中的表格内容：

来源：

document_obj.tables 通过 document 对象的 paragraphs 函数返回一个表格的列表；里面是一个一个的表格的对象。

使用方法：

同样通过循环，获取行与列的内容

返回值：

每个表格字段（字符串）

演示案例代码如下：

# coding:utf-8

import os
from docx import Document

path = os.path.join(os.getcwd(), 'test_file/文本.docx')
print("\'文本.docx\' 的路径为：", path)     # 调试路径

doc = Document(path)

# for p in doc.paragraphs:
#     print(p.text)

for t in doc.tables:            # for 循环获取表格对象
    for row in t.rows:          # 获取每一行
        row_str = []
        for cell in row.cells:    # 获取每一行单独的小表格,然后将其内容拼接起来;拼接完成之后再第二个for循环中打印出来
            row_str.append(cell.text)
        print(row_str)
        
# 也可以通过 "columns" 获取表格中的列的内容，可以自己尝试一下

运行结果如下：

到此这篇关于Python自动化办公之Word文件内容的读取的文章就介绍到这了,更多相关Python读取Word内容内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

搭建pypi私有仓库实现过程详解
这篇文章主要介绍了搭建pypi私有仓库实现过程详解,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下
2020-11-11
Anaconda出现CondaHTTPError: HTTP 000 CONNECTION FAILED for url
使用anaconda创建一个新的环境，执行“conda create -n scrapyEnv python=3.6”，结果出现了CondaHTTPError，下面我们就一起来了解一下解决方法吧
2021-05-05
神经网络相关之基础概念的讲解
今天小编就为大家分享一篇关于神经网络相关之基础概念的讲解，小编觉得内容挺不错的，现在分享给大家，具有很好的参考价值，需要的朋友一起跟随小编来看看吧
2018-12-12
python logging模块的使用总结
这篇文章主要介绍了python logging模块使用总结以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。,需要的朋友可以参考下
2019-07-07
python利用urllib实现爬取京东网站商品图片的爬虫实例
下面小编就为大家带来一篇python利用urllib实现爬取京东网站商品图片的爬虫实例。小编觉得挺不错的，现在就分享给大家，也给大家做个参考。一起跟随小编过来看看吧
2017-08-08
python 数据库查询返回list或tuple实例
这篇文章主要介绍了python 数据库查询返回list或tuple实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-05-05
Windows环境下如何使用Pycharm运行sh文件
这篇文章主要介绍了Windows环境下如何使用Pycharm运行sh文件,本文给大家介绍的非常详细，对大家的学习或工作具有一定的参考借鉴价值，需要的朋友可以参考下
2023-02-02
对python读取zip压缩文件里面的csv数据实例详解
今天小编就为大家分享一篇对python读取zip压缩文件里面的csv数据实例详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2019-02-02
解决Python 写文件报错TypeError的问题
这篇文章主要介绍了解决Python 写文件报错TypeError的问题，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧
2020-10-10
Python3enumrate和range对比及示例详解
这篇文章主要介绍了Python3enumrate和range对比及示例详解，在Python中，enumrate和range都常用于for循环中，enumrate函数用于同时循环列表和元素，而range()函数可以生成数值范围变化的列表，而能够用于for循环即都是可迭代的,需要的朋友可以参考下
2019-07-07