Python批量读取文件夹所有PDF文字 汇总教程
用Python遍历文件夹下所有PDF,逐本提取文字并汇总成一个txt/Excel清单,适合做资料归档、全文检索前处理。
场景痛点
手里堆了几十个PDF合同、标书、说明书,想把里面的文字全部
用Python遍历文件夹下所有PDF,逐本提取文字并汇总成一个txt/Excel清单,适合做资料归档、全文检索前处理。
场景痛点
手里堆了几十个PDF合同、标书、说明书,想把里面的文字全部
用Python的PyMuPDF压缩PDF文件体积,自动清理冗余对象、压缩嵌入图片、去重字体,几十MB的扫描件能压到几MB,适合邮件附件和归档。
场景痛点
扫描件、合同、产品手册PDF动辄几十M
用Python+PyPDF2给PDF设置打开密码、解除已有密码,批量加解密,适合合同外发前自动加密。
场景痛点
对外发送合同时经常要给PDF加打开密码,防止泄露;收到带密码的PDF时又要批量解
用Python+LibreOffice把xlsx批量转PDF,自动适配A4纸张、缩放列宽,避免表格被切到多页,适合把对账单、报表批量导出成PDF归档。
场景痛点
Excel报表发给客户,对方没装Office打开
用Python读取PDF内置书签/大纲(Outlines),提取章节名和对应页码,导出为Excel或TXT,方便做索引目录。
场景痛点
很多PDF(尤其是电子书、合同、规范)自带左侧书签目录,但想把这份目录
用Python+PyPDF2把PDF里嵌入的所有图片批量抽出来保存为PNG/JPG,按页码命名,整理素材不再逐页截图。
场景痛点
PDF里经常嵌入大量示意图、产品图、截图,需要单独拿出来用在PPT
用Python从原PDF中抽取指定几页(如第1、3、5、8页)组成一个新PDF,支持乱序抽取,一键完成。
场景痛点
经常需要从一份长PDF里挑出几页单独发出去,比如只要合同的第1页封面、第3-5
用Python的PyMuPDF读取PDF表单字段并批量填充,支持文本框、复选框、下拉框,填完另存为新文件,适合批量生成合同、申请表、报名表。
场景痛点
公司有一份固定模板的PDF合同或申
用Python读取PDF总页数、标题、作者、创建时间、修改时间等元数据,批量整理文件夹下PDF档案信息。
场景痛点
整理PDF档案时,经常需要知道每份文件多少页、谁创建的、什么时候
用Python的WeasyPrint把HTML模板或在线网页转成PDF,完整保留CSS样式、图片、字体,适合生成发票、合同、报表等带排版的文档。
场景痛点
业务系统里的订单、发票、对账单都是HT
用Python的Pillow把一个文件夹里的JPG/PNG按顺序合并成一个PDF,自动处理图片方向、RGB模式转换,适合把拍照、截图、扫描件打包成文档。
场景痛点
拍了一堆合同照片、产品截图
用Python的PyMuPDF在PDF任意坐标插入文字,支持指定字体、字号、颜色,也能按文字搜索定位插入点,适合在合同指定位置填日期、签字、盖章编号。
场景痛点
很多合同、协议是扫描件
用Python+PyPDF2把多个PDF按顺序合并成一个文件,支持自定义文件顺序、自动跳过损坏文件,告别手动拼接。
场景痛点
做项目汇总、合同装订、资料归档时,经常需要把十几个PDF按顺
用Python把扫描版PDF逐页转图片,再调用OCR引擎识别成文字,支持中文,处理图片型PDF不再手动录入。
场景痛点
扫描件、传真件、盖章合同都是图片型PDF,用pdfplumber/PyPDF2读出来
用Python的PyMuPDF给PDF指定区域添加超链接注释,点击直接跳转外部网址或邮箱,也能添加弹出注释(批注),适合在电子书、报告里加引用链接。
场景痛点
做电子书、研究报告、产品手册
用Python把PDF每一页导出为高清PNG图片,通过调整DPI控制清晰度,支持批量导出整个文件夹,适合做预览图、缩略图、OCR预处理。
场景痛点
有时候需要把PDF每页转成图片:做网页预览
用Python+pdfplumber只读取PDF中某一页或某几页的文字,不用整本加载,速度快、内存省,适合定位关键页。
场景痛点
拿到一份几百页的PDF,只想看第10页的合同条款或者第20页的报价
用Python+pdfplumber自动识别PDF中的表格,导出为Excel文件,合并多页表格,告别手动复制单元格。
场景痛点
财报、发票、价目表、统计报表经常以PDF格式下发,里面是密密麻麻的表格
用Python+pdfplumber快速读取PDF整本或单页文字,自动去除换行与多余空格,输出干净的纯文本,告别手工复制粘贴。
场景痛点
工作中经常遇到需要把PDF里的文字复制出来做整理、归
用Python的reportlab库从零生成一份带标题、正文和中文字体的PDF文件,覆盖画页、写文字、设置字号颜色、保存输出,适合做合同、报告、收据模板。
场景痛点
工作中经常需要把一
用Python+PyPDF2把PDF所有页面统一旋转90/180/270度,或只旋转指定页,处理扫描时拍歪、方向颠倒的PDF。
场景痛点
用手机扫描APP拍出来的PDF经常方向不对:横拍变竖版、扫描件倒
用Python把扫描仪扫出来的一堆JPG/TIFF按命名顺序批量合并成PDF,自动处理多页文档、跳过重复页、生成归档命名,适合财务单据、合同归档。
场景痛点
扫描仪一次性扫完一份合同,
用Python读取PDF书签目录,自动按一级章节把整本PDF拆成多个小PDF,每个章节一个文件,保留文件名。
场景痛点
一本几百页的PDF电子书或规范,自带书签目录,想按章节拆成独立小文件发
用Python+PyPDF2按页码区间把一个大PDF拆成多个小PDF,支持平均拆分、按指定区间拆分,秒完成。
场景痛点
一个几百页的PDF合同或扫描件,只需要把其中某几页单独抽出来发邮件给客
用Python调用LibreOffice无头模式把docx批量转成PDF,跨Windows/Mac/Linux,不依赖Word授权,适合服务器批量处理合同、报告、通知。
场景痛点
公司每天要把一堆docx合同、通知、
用Python shutil和pathlib把指定目录下的文件批量备份到另一目录,自动创建目标目录、保留修改时间,完整代码可运行。
场景痛点
每天下班前要把当天处理的报表、合同从工作盘复
用 Python 批量给文件夹里所有文件统一加前缀或后缀,如「2024Q3_报表.xlsx」「报告_最终版.pdf」,支持只加一次、避免重复添加,附预览。
场景痛点
一个项目的资料散在各个文件
用 Python 读取文件修改时间,把文件自动归档到「2024-01」「2024-02」这样的年月文件夹,适合整理聊天记录、下载文件、日志、照片。
场景痛点
下载目录、聊天接收文件夹、服务
用Python pathlib批量修改目录下所有文件的扩展名,比如把.txt改成.md、.jpeg改成.jpg,自动跳过子目录,完整代码。
场景痛点
从某个系统导出的文件全是.jpeg后缀,上传平台只认.jp
用Python批量设置文件的创建时间、修改时间、访问时间,支持从文件名提取日期、统一设为指定时间,整理归档文件时间戳利器。
Python批量修改文件创建时间修改时间教程
场景痛点