Python读取Word文档中的Excel嵌入文件的方法详解

 更新时间:2022年12月14日 08:47:07   作者:小小明-代码实体  
这篇文章主要为大家详细介绍了Python读取Word文档中的Excel嵌入文件的方法,文中的示例代码讲解详细,具有一定的借鉴价值,需要的可以参考一下

今天群友提出一个问题:

给出Word示例如下:

对于这种嵌入文件在Word中都属于ole文件。

下面我们假设需要读取每个嵌入的Excel文件中的python工作表中的A1单元格。

python调用宏实现

首先我们看看如何调用com接口的宏代码实现这个效果,最终完整代码如下:

from win32com import client as win32
import os

word = win32.Dispatch("Word.Application")
word.Visible = True
wdDoc = word.Documents.Open(os.path.abspath("test.docx"))
try:
    for shape in wdDoc.InlineShapes:
        if shape.Type != 1 or not shape.OLEFormat.ProgID.startswith("Excel.Sheet"):
            # 要求形状类型为wdInlineShapeEmbeddedOLEObject,是Excel类型的OLE对象
            continue
        shape.OLEFormat.Open()
        xlApp = win32.GetActiveObject('Excel.Application')
        book = xlApp.Workbooks(1)
        print([sht.Name for sht in book.Sheets])
        print(book.Sheets("python").Range("A1").Value)
        book.Close()
finally:
    wdDoc.Close()
    xlApp.Quit()
    word.Quit()

执行结果:

['java', 'forever', 'python']
python
['java', 'forever', 'python']
python hello world
['java', 'forever', 'python']
python

注意:此方法仅支持在已安装办公软件(office或WPS)的windows环境下使用。

python解析ole文件实现

我通过压缩软件看到三个Excel文件其实是以ole的bin文件形式存储:

我们也只需要理解并解析这些文件就可以得到对应的Excel文件,然后直接使用openpyxl或pandas解析。

HY.Li大佬提供了对应的代码:

思路与我的想法不谋而合,不过我不知道用olefile这个现成的库可以解析这些文件,原本还打算自己实现一下。

参考上面的代码,最终我的实现如下:

import olefile
from zipfile import ZipFile
from openpyxl import load_workbook

filename = "test.docx"
with ZipFile(filename, "r") as zip_file:
    for name in zip_file.namelist():
        if not name.startswith("word/embeddings/"):
            continue
        with zip_file.open(name) as f:
            if not olefile.isOleFile(f):
                continue
            ole = olefile.OleFileIO(f)
            try:
                book = load_workbook(ole.openstream("package"))
                print(book.sheetnames)
                print(book["python"]["A1"].value)
            except Exception as e:
                print(name, "当前ole对象不是Excel文件:", e)

结果:

['java', 'forever', 'python']
python
['java', 'forever', 'python']
python hello world
['java', 'forever', 'python']
python

相对来说,此方法跨平台,速度快。

到此这篇关于Python读取Word文档中的Excel嵌入文件的方法详解的文章就介绍到这了,更多相关Python读取Word中的Excel嵌入文件内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家!

相关文章

  • 基于Python的Jenkins的二次开发操作

    基于Python的Jenkins的二次开发操作

    这篇文章主要介绍了基于Python的Jenkins的二次开发操作,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧
    2020-05-05
  • python字符串排序方法

    python字符串排序方法

    这篇文章主要介绍了python字符串排序方法,基于lambda实现,是非常实用的技巧,需要的朋友可以参考下
    2014-08-08
  • Python创建二维数组与初始化的实践举例

    Python创建二维数组与初始化的实践举例

    二维数组使用简便可以有很多简洁的操作,实现多元的要求,下面这篇文章主要给大家介绍了关于Python创建二维数组与初始化的相关资料,文中通过实例代码介绍的非常详细,需要的朋友可以参考下
    2022-12-12
  • Python3实现发送QQ邮件功能(html)

    Python3实现发送QQ邮件功能(html)

    这篇文章主要为大家详细介绍了Python3实现发送QQ邮件功能,html格式的qq邮件,具有一定的参考价值,感兴趣的小伙伴们可以参考一下
    2017-12-12
  • python迭代器模块itertools常用的方法

    python迭代器模块itertools常用的方法

    这篇文章主要介绍了python迭代器模块itertools常用的方法,文章围绕主题展开详细的内容介绍,具有一定的参考价值,需要的小伙伴可以参考一下
    2022-09-09
  • wxpython中自定义事件的实现与使用方法分析

    wxpython中自定义事件的实现与使用方法分析

    这篇文章主要介绍了wxpython中自定义事件的实现与使用方法,结合实例形式详细分析了wxpython中自定义事件的创建步骤与使用方法,需要的朋友可以参考下
    2016-07-07
  • pytorch中retain_graph==True的作用说明

    pytorch中retain_graph==True的作用说明

    这篇文章主要介绍了pytorch中retain_graph==True的作用说明,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
    2023-02-02
  • Python pytest自动化测试库十个强大用法示例

    Python pytest自动化测试库十个强大用法示例

    本文将介绍Python的pytest库的10个强大用法,并提供相应的代码示例,帮助你更好地理解和应用单元测试,它提供了许多高级功能和便利的用法,能够让我们更轻松地编写和执行单元测试
    2024-01-01
  • TensorFlow MNIST手写数据集的实现方法

    TensorFlow MNIST手写数据集的实现方法

    MNIST数据集中包含了各种各样的手写数字图片,这篇文章主要介绍了TensorFlow MNIST手写数据集的实现方法,需要的朋友可以参考下
    2020-02-02
  • pytorch 中nn.Dropout的使用说明

    pytorch 中nn.Dropout的使用说明

    这篇文章主要介绍了pytorch 中nn.Dropout的使用说明,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望不吝赐教
    2021-05-05

最新评论