Python 自动化:从文件批处理开始
自动化的第一桶金,往往是「把重复的手工操作交给脚本」。Python 标准库就能搞定大部分文件与表格处理,几乎零依赖。
一、环境准备
装好 Python 3 后,建议为每个项目建虚拟环境,避免包互相污染:
python -m venv .venv source .venv/bin/activate # Windows: .venv\Scripts\activate pip install requests pandas
二、批量重命名文件
用 pathlib 比拼字符串路径稳得多,跨平台也不用担心斜杠方向:
from pathlib import Path
for f in Path("./photos").glob("*.jpg"):
new = f.with_name(f"img_{f.stem}.jpg")
f.rename(new)
print(f"renamed -> {new.name}")
三、读写 CSV
简单场景用标准库 csv,数据量大再用 pandas。下面用标准库给每行加一列:
import csv
with open("in.csv", newline="", encoding="utf-8") as f:
rows = list(csv.reader(f))
rows[0].append("score") # 表头加一列
for r in rows[1:]:
r.append(str(len(r[0]) * 10)) # 简单示例值
with open("out.csv", "w", newline="", encoding="utf-8") as f:
csv.writer(f).writerows(rows)
四、写个定时任务
脚本写好后,用系统定时任务周期性跑:macOS / Linux 用 crontab -e 加一行;Windows 用任务计划程序。例如每天 9 点执行:
0 9 * * * /path/.venv/bin/python /path/rename.py
五、爬虫入门提醒
用 requests 抓页面很方便,但请先读目标站的 robots.txt 与 Terms,控制请求频率,别给对方服务器添堵——这是基本礼貌,也是合规底线。
小建议:脚本先在小样本上跑通、打印日志确认无误,再套到全量数据上,能省掉无数「跑了一半发现删错文件」的悲剧。