参考 · Reference

pandas 核心词汇速查

只收录本工作区用到过的词。新词随课程增加,定义以这里的说法为准。

术语

pandas · pandas
Python 的表格数据处理库。惯例 import pandas as pd,之后一律写 pd.xxx
DataFrame · 数据框
一张带列名的二维表:行是记录,列是字段。Excel 的一张工作表 ≈ 一个 DataFrame。
Series · 序列
DataFrame 的一列(或一行)。它带着自己那串行号,所以能和其他列"对齐着"算。
index · 索引
行号/行标签。读 CSV 时默认是 0,1,2,…。它是 DataFrame 和普通二维数组的关键区别——行也有名字。
columns · 列名
表头的名字。中文列名完全可用(df["营业总收入_亿元"])。但列名必须一字不差,包括下划线和括号——这是新手最常见的报错来源。
read_csv() · 读 CSV
pd.read_csv("路径") → 把 CSV 文件读成 DataFrame。文件路径是相对当前终端目录的。
vectorized operation · 向量化运算
整个 Series 一次算完,不用写循环。df["a"] / df["b"] 就是。pandas 最重要的心智模型。
new column by assignment · 赋值造列
df["新列名"] = 算式 就新增/覆盖一列。pandas 里没有单独的"插入列"操作,赋值即新增。
reporting period · 报告期
财报的时间刻度。命名惯例 20251231 = 2025 年年报;20250630 = 2025 年中报。看长期基本面时,只取以 1231 结尾的列。

三类动作的写法(照抄即可)

想做什么怎么写
读文件df = pd.read_csv("路径.csv")
看表长什么样df / df.head() / df.shape / df.columns
取一列df["列名"]
取多列df[["列名1", "列名2"]] ← 注意是双层方括号
造新列df["新列名"] = df["a"] / df["b"] * 100
四舍五入(算式).round(1)
最常见的两个坑

① 单层 vs 双层方括号df["列名"] 得到一列(Series);df[["列名"]] 得到一张只有这一列的表(DataFrame)。多列时只能用双层。

② 相对路径read_csv("assets/data/x.csv") 是从终端的当前目录算的,不是从脚本文件所在目录算的。跑之前先 pwd

本工作区的数据来源(唯一权威顺序)

  1. 年报原文巨潮资讯网)— 最终裁决。
  2. AKShare 接口文档)— 日常取数。
  3. 别用二手转载的指标数字。对不上时,是它错。

最后更新:2026-09-24(配合第 1 课)