参考 · Reference
只收录本工作区用到过的词。新词随课程增加,定义以这里的说法为准。
pandas · pandasimport pandas as pd,之后一律写 pd.xxx。DataFrame · 数据框Series · 序列index · 索引0,1,2,…。它是 DataFrame 和普通二维数组的关键区别——行也有名字。columns · 列名df["营业总收入_亿元"])。但列名必须一字不差,包括下划线和括号——这是新手最常见的报错来源。read_csv() · 读 CSVpd.read_csv("路径") → 把 CSV 文件读成 DataFrame。文件路径是相对当前终端目录的。vectorized operation · 向量化运算df["a"] / df["b"] 就是。pandas 最重要的心智模型。new column by assignment · 赋值造列df["新列名"] = 算式 就新增/覆盖一列。pandas 里没有单独的"插入列"操作,赋值即新增。reporting period · 报告期20251231 = 2025 年年报;20250630 = 2025 年中报。看长期基本面时,只取以 1231 结尾的列。| 想做什么 | 怎么写 |
|---|---|
| 读文件 | df = pd.read_csv("路径.csv") |
| 看表长什么样 | df / df.head() / df.shape / df.columns |
| 取一列 | df["列名"] |
| 取多列 | df[["列名1", "列名2"]] ← 注意是双层方括号 |
| 造新列 | df["新列名"] = df["a"] / df["b"] * 100 |
| 四舍五入 | (算式).round(1) |
① 单层 vs 双层方括号:df["列名"] 得到一列(Series);df[["列名"]] 得到一张只有这一列的表(DataFrame)。多列时只能用双层。
② 相对路径:read_csv("assets/data/x.csv") 是从终端的当前目录算的,不是从脚本文件所在目录算的。跑之前先 pwd。
最后更新:2026-09-24(配合第 1 课)