Python pandas字符串处理分列替换教程
用pandas的str.split分列、str.replace替换、str.extract提取、str.contains筛选,处理Excel里混在一格的电话、地址、商品名等脏字符串。
场景痛点
从系统导出的表格,姓名和电
用pandas的str.split分列、str.replace替换、str.extract提取、str.contains筛选,处理Excel里混在一格的电话、地址、商品名等脏字符串。
场景痛点
从系统导出的表格,姓名和电
用Python标准库csv模块读取CSV文件,不需要安装pandas,逐行解析表头和数据,适合小文件和轻量场景,附完整可运行代码。
场景痛点
日常工作里CSV到处都是:导出的订单表、后台日志、
用Python标准库json读取本地JSON文件,支持dict和list两种根结构,中文不转义、处理嵌套字段,附完整可运行代码。
场景痛点
接口返回的数据、配置文件、前端传过来的数据都是JSON
用pandas分块读取、指定dtypes、只读必要列、只读过滤后的数据,解决几十万行CSV/Excel读取内存爆掉的问题,机器低配也能跑。
场景痛点
手头CSV文件几百MB甚至几个GB,pd.read_cs
用pandas按某一列的值把一个大CSV拆成多个小文件,比如按城市、按日期、按类别拆分,自动命名、自动建文件夹,附完整代码。
场景痛点
一份全国订单表,要按城市分别发给各区域负责
用Python内置sqlite3模块完成SQLite数据库的建表、插入、查询、更新、删除全流程,代码可直接运行,适合办公自动化数据落库场景。
场景痛点
做报表、跑脚本经常要把中间结果存
把SQLite查询结果直接导出成xlsx,支持多级表头、自动列宽、数字格式,适合每周给业务方出报表,不用再手动复制粘贴。
场景痛点
数据库里查出来的数据,业务方要Excel版本,每次手动S
用Python把数据写入CSV文件,分别给出标准库csv和pandas to_csv两种写法,支持中文表头、追加模式、自定义分隔符,附完整代码。
场景痛点
处理完数据要导出给同事、传给系统、做
用Python标准库json把dict/list写入JSON文件,解决中文被转义成\uXXXX的问题,支持缩进美化、原子写入,附完整代码。
场景痛点
把Python字典存成JSON给前端、给下游系统用,结果打
讲解用Python requests调用公开汇率API,获取实时汇率并批量计算人民币对美元、欧元等多币种换算结果,适合外贸、财务报表自动化。
场景痛点
做外贸、跨境电商、财务对账经常要
讲解用Python requests调用公开天气API,传入城市名获取实时温度、湿度、风力,解析JSON返回并格式化输出,适合做日报、监控、自动化报表。
场景痛点
每天早上要做晨会日报,天气预
讲解用requests批量抓取多个网页完整HTML保存到本地,自动建目录、按URL生成文件名,方便离线归档、备份网页内容、做本地镜像。
场景痛点
工作中遇到重要网页想留档:规章制度页
讲解用requests配合BeautifulSoup批量抓取多个网页的标题,线程池并发提速,把结果存成CSV清单,适合竞品监控、文章列表收集、网页索引整理。
场景痛点
手里有一堆URL,可能是从Exc
讲解用BeautifulSoup解析HTML table标签,遍历tr和td把表格数据读成二维列表,再导出成CSV文件,适合抓取网页上的名单、价格、排行榜。
场景痛点
网页上有一张产品价格表、比赛成
讲解用BeautifulSoup解析HTML,通过find、select定位标签,提取正文文字并去掉多余空白,适合从抓取到的网页中抽取需要的文本内容。
场景痛点
requests拿到网页HTML后是一长串标
讲解用requests循环批量下载文件,配合线程池并发提速,自动跳过已存在文件、记录失败清单,适合大批量图片/文档素材下载。
场景痛点
单个文件下载慢,几百个文件排队串行下更慢,等
讲解requests中Cookie的读取、手动设置、从浏览器复制Cookie字符串加载、持久化到本地文件,适合需要登录态但又不想每次都登录的场景。
场景痛点
很多网站登录有验证码、有扫
用requests以流式方式下载网络图片到本地,处理大文件边下边存不占内存,自动识别扩展名,适合批量保存素材、图标、照片。
场景痛点
设计稿里有几十张配图、产品库有几百张主图,手
讲解用requests以二进制流式方式下载PDF文件,处理Content-Disposition自动取文件名,批量下载网页中的PDF附件,适合合同、报告、资料归档。
场景痛点
工作中经常要从OA系统、公
用Python requests库发起第一个GET请求,获取网页HTML源码,讲解status_code、text、encoding等核心用法,适合零基础入门网页抓取。
场景痛点
工作中经常需要从固定网页上复制一
讲解requests自定义Headers,伪装User-Agent、Referer、Accept等字段,让请求看起来像真实浏览器,解决裸请求被服务器拒绝的403问题。
场景痛点
写好GET请求一跑,结果返回403 Forb
讲解用requests调用JSON API并用resp.json()把响应转成Python字典,逐层取字段、处理嵌套数据,适合对接天气、汇率、内部接口。
场景痛点
现在大多数后台接口返回的都是JSON,不
讲解用requests循环抓取多页列表数据,自动识别下一页按钮或页码参数,遇到空数据自动停止,适合文章列表、商品列表、搜索结果分页抓取。
场景痛点
搜索结果、文章列表、商品页都
讲解requests用data字典提交POST表单,模拟网页登录、评论、搜索提交等场景,对比GET与POST区别,附带异常处理。
场景痛点
工作中经常遇到需要"点按钮提交"的场景:批量提交工单、
讲解requests用params字典发起带查询参数的GET请求,自动拼接URL并编码中文,避免手动拼接字符串出错,适合搜索、分页、筛选场景。
场景痛点
很多网页和接口不是一个固定URL,而是
讲解用requests.Session()复用TCP连接和Cookie,模拟登录后连续访问多个页面,避免每次请求都重新握手,适合需要登录态的抓取场景。
场景痛点
用requests第一次请求登录接口拿到C
讲解requests设置timeout防止卡死,用urllib3的Retry适配器实现失败自动重试,配合backoff指数退避,提升网络抓取脚本的健壮性。
场景痛点
跑爬虫脚本跑到一半卡住不动,Ctrl+C一看
讲解requests伪装浏览器User-Agent的多种方法,随机UA池、多浏览器头轮换、处理简单反爬检测,提高脚本被识别为脚本的难度。
场景痛点
用同一个User-Agent连续请求几十次,服务器
讲解用BeautifulSoup和正则两种方式从网页中提取所有超链接,过滤外链和无效链接,去重后导出成CSV清单,适合做站点地图、链接巡检。
场景痛点
手上有一个网站想整理出所有内部链
Python 脚本设置开机自启动,Windows 用启动文件夹和注册表、Linux 用 systemd 服务、Mac 用 LaunchAgent,配合 nohup 实现无人值守常驻运行。
场景痛点
写好一个定时任务或监