我的知识记录

Python批量读取文件夹所有PDF文字 汇总教程

用Python遍历文件夹下所有PDF,逐本提取文字并汇总成一个txt/Excel清单,适合做资料归档、全文检索前处理。
场景痛点
手里堆了几十个PDF合同、标书、说明书,想把里面的文字全部

Python压缩PDF文件体积:垃圾回收+图片降采样

用Python的PyMuPDF压缩PDF文件体积,自动清理冗余对象、压缩嵌入图片、去重字体,几十MB的扫描件能压到几MB,适合邮件附件和归档。
场景痛点
扫描件、合同、产品手册PDF动辄几十M

Python加密PDF与解密PDF PyPDF2 方法

用Python+PyPDF2给PDF设置打开密码、解除已有密码,批量加解密,适合合同外发前自动加密。
场景痛点
对外发送合同时经常要给PDF加打开密码,防止泄露;收到带密码的PDF时又要批量解

Python Excel转PDF:表格不溢出分页打印

用Python+LibreOffice把xlsx批量转PDF,自动适配A4纸张、缩放列宽,避免表格被切到多页,适合把对账单、报表批量导出成PDF归档。
场景痛点
Excel报表发给客户,对方没装Office打开

Python PDF提取目录书签 大纲导出教程

用Python读取PDF内置书签/大纲(Outlines),提取章节名和对应页码,导出为Excel或TXT,方便做索引目录。
场景痛点
很多PDF(尤其是电子书、合同、规范)自带左侧书签目录,但想把这份目录

Python读取PDF全部图片 一键提取教程

用Python+PyPDF2把PDF里嵌入的所有图片批量抽出来保存为PNG/JPG,按页码命名,整理素材不再逐页截图。
场景痛点
PDF里经常嵌入大量示意图、产品图、截图,需要单独拿出来用在PPT

Python提取PDF指定页面为新文件 方法详解

用Python从原PDF中抽取指定几页(如第1、3、5、8页)组成一个新PDF,支持乱序抽取,一键完成。
场景痛点
经常需要从一份长PDF里挑出几页单独发出去,比如只要合同的第1页封面、第3-5

Python填写PDF表单字段:自动批量填合同

用Python的PyMuPDF读取PDF表单字段并批量填充,支持文本框、复选框、下拉框,填完另存为新文件,适合批量生成合同、申请表、报名表。
场景痛点
公司有一份固定模板的PDF合同或申

Python获取PDF页数与元信息 标题作者教程

用Python读取PDF总页数、标题、作者、创建时间、修改时间等元数据,批量整理文件夹下PDF档案信息。
场景痛点
整理PDF档案时,经常需要知道每份文件多少页、谁创建的、什么时候

Python HTML网页转PDF:WeasyPrint保留CSS样式

用Python的WeasyPrint把HTML模板或在线网页转成PDF,完整保留CSS样式、图片、字体,适合生成发票、合同、报表等带排版的文档。
场景痛点
业务系统里的订单、发票、对账单都是HT

Python多张图片合成PDF:Pillow一键打包教程

用Python的Pillow把一个文件夹里的JPG/PNG按顺序合并成一个PDF,自动处理图片方向、RGB模式转换,适合把拍照、截图、扫描件打包成文档。
场景痛点
拍了一堆合同照片、产品截图

Python在PDF指定位置插入文字:盖章签字位

用Python的PyMuPDF在PDF任意坐标插入文字,支持指定字体、字号、颜色,也能按文字搜索定位插入点,适合在合同指定位置填日期、签字、盖章编号。
场景痛点
很多合同、协议是扫描件

Python PyPDF2合并多个PDF 一键合成教程

用Python+PyPDF2把多个PDF按顺序合并成一个文件,支持自定义文件顺序、自动跳过损坏文件,告别手动拼接。
场景痛点
做项目汇总、合同装订、资料归档时,经常需要把十几个PDF按顺

Python扫描PDF文字OCR识别 图片转文字教程

用Python把扫描版PDF逐页转图片,再调用OCR引擎识别成文字,支持中文,处理图片型PDF不再手动录入。
场景痛点
扫描件、传真件、盖章合同都是图片型PDF,用pdfplumber/PyPDF2读出来

Python PDF添加链接注释:点击文字跳转网页

用Python的PyMuPDF给PDF指定区域添加超链接注释,点击直接跳转外部网址或邮箱,也能添加弹出注释(批注),适合在电子书、报告里加引用链接。
场景痛点
做电子书、研究报告、产品手册

Python PDF转图片每页高清:PyMuPDF导出PNG教程

用Python把PDF每一页导出为高清PNG图片,通过调整DPI控制清晰度,支持批量导出整个文件夹,适合做预览图、缩略图、OCR预处理。
场景痛点
有时候需要把PDF每页转成图片:做网页预览

Python读取PDF指定页文字 单页提取方法

用Python+pdfplumber只读取PDF中某一页或某几页的文字,不用整本加载,速度快、内存省,适合定位关键页。
场景痛点
拿到一份几百页的PDF,只想看第10页的合同条款或者第20页的报价

Python读取PDF表格数据转Excel pdfplumber实战

用Python+pdfplumber自动识别PDF中的表格,导出为Excel文件,合并多页表格,告别手动复制单元格。
场景痛点
财报、发票、价目表、统计报表经常以PDF格式下发,里面是密密麻麻的表格

Python读取PDF文本内容 pdfplumber 实战教程

用Python+pdfplumber快速读取PDF整本或单页文字,自动去除换行与多余空格,输出干净的纯文本,告别手工复制粘贴。
场景痛点
工作中经常遇到需要把PDF里的文字复制出来做整理、归

Python reportlab生成简单PDF:三行代码出一份合同

用Python的reportlab库从零生成一份带标题、正文和中文字体的PDF文件,覆盖画页、写文字、设置字号颜色、保存输出,适合做合同、报告、收据模板。
场景痛点
工作中经常需要把一

Python PDF旋转页面方向 批量转正教程

用Python+PyPDF2把PDF所有页面统一旋转90/180/270度,或只旋转指定页,处理扫描时拍歪、方向颠倒的PDF。
场景痛点
用手机扫描APP拍出来的PDF经常方向不对:横拍变竖版、扫描件倒

Python扫描件批量生成PDF:按文件名排序合并

用Python把扫描仪扫出来的一堆JPG/TIFF按命名顺序批量合并成PDF,自动处理多页文档、跳过重复页、生成归档命名,适合财务单据、合同归档。
场景痛点
扫描仪一次性扫完一份合同,

Python PDF按书签批量拆分 章节拆分教程

用Python读取PDF书签目录,自动按一级章节把整本PDF拆成多个小PDF,每个章节一个文件,保留文件名。
场景痛点
一本几百页的PDF电子书或规范,自带书签目录,想按章节拆成独立小文件发

Python拆分PDF按页码 一页一个文件方法

用Python+PyPDF2按页码区间把一个大PDF拆成多个小PDF,支持平均拆分、按指定区间拆分,秒完成。
场景痛点
一个几百页的PDF合同或扫描件,只需要把其中某几页单独抽出来发邮件给客

Python Word转PDF:LibreOffice批量转换教程

用Python调用LibreOffice无头模式把docx批量转成PDF,跨Windows/Mac/Linux,不依赖Word授权,适合服务器批量处理合同、报告、通知。
场景痛点
公司每天要把一堆docx合同、通知、

Python文件备份到另一目录教程:shutil一键同步

用Python shutil和pathlib把指定目录下的文件批量备份到另一目录,自动创建目标目录、保留修改时间,完整代码可运行。
场景痛点
每天下班前要把当天处理的报表、合同从工作盘复

Python批量修改文件创建时间和修改时间教程

用Python批量设置文件的创建时间、修改时间、访问时间,支持从文件名提取日期、统一设为指定时间,整理归档文件时间戳利器。
Python批量修改文件创建时间修改时间教程
场景痛点