我的知识记录

Python pandas字符串处理分列替换教程

用pandas的str.split分列、str.replace替换、str.extract提取、str.contains筛选,处理Excel里混在一格的电话、地址、商品名等脏字符串。
场景痛点
从系统导出的表格,姓名和电

Python读取CSV文件 csv模块教程:标准库一行读出来

用Python标准库csv模块读取CSV文件,不需要安装pandas,逐行解析表头和数据,适合小文件和轻量场景,附完整可运行代码。
场景痛点
日常工作里CSV到处都是:导出的订单表、后台日志、

Python读取JSON文件教程:标准库json详解

用Python标准库json读取本地JSON文件,支持dict和list两种根结构,中文不转义、处理嵌套字段,附完整可运行代码。
场景痛点
接口返回的数据、配置文件、前端传过来的数据都是JSON

Python读取大文件内存优化实战

用pandas分块读取、指定dtypes、只读必要列、只读过滤后的数据,解决几十万行CSV/Excel读取内存爆掉的问题,机器低配也能跑。
场景痛点
手头CSV文件几百MB甚至几个GB,pd.read_cs

Python按条件拆分CSV教程:按列值分成多个文件

用pandas按某一列的值把一个大CSV拆成多个小文件,比如按城市、按日期、按类别拆分,自动命名、自动建文件夹,附完整代码。
场景痛点
一份全国订单表,要按城市分别发给各区域负责

Python操作SQLite数据库增删改查完整教程

用Python内置sqlite3模块完成SQLite数据库的建表、插入、查询、更新、删除全流程,代码可直接运行,适合办公自动化数据落库场景。
场景痛点
做报表、跑脚本经常要把中间结果存

Python从SQLite查询结果导出Excel文件

把SQLite查询结果直接导出成xlsx,支持多级表头、自动列宽、数字格式,适合每周给业务方出报表,不用再手动复制粘贴。
场景痛点
数据库里查出来的数据,业务方要Excel版本,每次手动S

Python写入CSV文件教程:csv模块与pandas两种写法

用Python把数据写入CSV文件,分别给出标准库csv和pandas to_csv两种写法,支持中文表头、追加模式、自定义分隔符,附完整代码。
场景痛点
处理完数据要导出给同事、传给系统、做

Python写入JSON文件教程:json.dump中文不转义

用Python标准库json把dict/list写入JSON文件,解决中文被转义成\uXXXX的问题,支持缩进美化、原子写入,附完整代码。
场景痛点
把Python字典存成JSON给前端、给下游系统用,结果打

Python调用公开API获取天气数据:实时查询与解析

讲解用Python requests调用公开天气API,传入城市名获取实时温度、湿度、风力,解析JSON返回并格式化输出,适合做日报、监控、自动化报表。
场景痛点
每天早上要做晨会日报,天气预

Python批量抓取网页存成本地HTML:离线镜像与归档

讲解用requests批量抓取多个网页完整HTML保存到本地,自动建目录、按URL生成文件名,方便离线归档、备份网页内容、做本地镜像。
场景痛点
工作中遇到重要网页想留档:规章制度页

Python BeautifulSoup提取表格数据:HTML表格转CSV示例

讲解用BeautifulSoup解析HTML table标签,遍历tr和td把表格数据读成二维列表,再导出成CSV文件,适合抓取网页上的名单、价格、排行榜。
场景痛点
网页上有一张产品价格表、比赛成

Python requests批量下载文件:多线程提速与失败重试

讲解用requests循环批量下载文件,配合线程池并发提速,自动跳过已存在文件、记录失败清单,适合大批量图片/文档素材下载。
场景痛点
单个文件下载慢,几百个文件排队串行下更慢,等

Python requests处理Cookie:手动携带与本地保存

讲解requests中Cookie的读取、手动设置、从浏览器复制Cookie字符串加载、持久化到本地文件,适合需要登录态但又不想每次都登录的场景。
场景痛点
很多网站登录有验证码、有扫

Python requests下载图片文件:流式保存与文件命名

用requests以流式方式下载网络图片到本地,处理大文件边下边存不占内存,自动识别扩展名,适合批量保存素材、图标、照片。
场景痛点
设计稿里有几十张配图、产品库有几百张主图,手

Python requests下载PDF附件:二进制保存与批量导出

讲解用requests以二进制流式方式下载PDF文件,处理Content-Disposition自动取文件名,批量下载网页中的PDF附件,适合合同、报告、资料归档。
场景痛点
工作中经常要从OA系统、公

Python requests爬取分页数据:循环翻页与停止条件

讲解用requests循环抓取多页列表数据,自动识别下一页按钮或页码参数,遇到空数据自动停止,适合文章列表、商品列表、搜索结果分页抓取。
场景痛点
搜索结果、文章列表、商品页都

Python requests带参数查询教程:GET传参与URL拼接

讲解requests用params字典发起带查询参数的GET请求,自动拼接URL并编码中文,避免手动拼接字符串出错,适合搜索、分页、筛选场景。
场景痛点
很多网页和接口不是一个固定URL,而是

Python requests保持会话Session:跨请求保留Cookie

讲解用requests.Session()复用TCP连接和Cookie,模拟登录后连续访问多个页面,避免每次请求都重新握手,适合需要登录态的抓取场景。
场景痛点
用requests第一次请求登录接口拿到C

Python requests设置超时与重试:网络抖动自动恢复

讲解requests设置timeout防止卡死,用urllib3的Retry适配器实现失败自动重试,配合backoff指数退避,提升网络抓取脚本的健壮性。
场景痛点
跑爬虫脚本跑到一半卡住不动,Ctrl+C一看