00 · 学习路径与总览
本章路线
0. 小白导读:先用一句话听懂"模块一"是什么
如果你是零基础,先别被"数据科学""统计编程"这些词吓到。用大白话说:
- Python(编程) = 一台"万能计算器 + 自动流水线"。你告诉它"怎么算、算哪些",它就能又快又准地帮你处理成千上万条数据,还能自动画图、自动重复操作。
- 统计 = 一位"公正的裁判"。实验做完了,数据摆在那里,到底有没有差异、差异可不可信?统计就是帮你下这个判断的规则。
- 两者合起来 = 你既会"算",又知道"怎么判断算得对不对"。这就是科研的基本功。
1. 为什么必须先学数据科学与统计编程?
你未来的研究方向是中药纳米制剂、心脑血管疾病与抑郁共病、网络药理学,这三个方向有一个共同点:一切结论都建立在数据之上。
- 网络药理学:中药成分-靶点矩阵、蛋白互作网络、富集分析——本质是矩阵运算与统计分析。
- 纳米制剂:粒径、包封率、释放曲线、细胞活力——本质是实验数据的统计比较(t 检验、ANOVA)。
- 共病机制研究:行为学数据、生化指标、组学数据——本质是数据清洗、统计推断与可视化。
换句话说:Python 是工具,统计是语言。不会 Python,你的数据只能靠别人处理;不懂统计,你无法判断自己的结论是否可信。
🎯一句话总结
一句话总结:编程让你"能算",统计让你"算得对、说得清"。
再打个比方:想象你是一位厨师(研究者)。
-
不会编程,就像没有菜刀和灶台——食材(数据)堆在那里,你只能干瞪眼。
-
不会统计,就像不会尝味道——菜做出来了,但你不知道咸淡合不合适,端上桌(投稿)会被打回。
-
两个都会,你才能独立完成"备料 → 烹饪 → 试味 → 上桌"的完整流程,也就是独立做科研。
2. 模块一学什么?
模块一包含两大支柱,共 7 个章节:
模块一 · 数据科学与统计编程
│
├── 支柱 A:Python 编程(第 01–05 章)
│ ├── 01 Python 基础语法 ⭐⭐⭐⭐⭐ 地基
│ ├── 02 NumPy 数值计算 ⭐⭐⭐⭐⭐ 矩阵运算
│ ├── 03 Pandas 数据处理 ⭐⭐⭐⭐⭐ 数据清洗
│ ├── 04 包管理与 Git ⭐⭐⭐⭐ 工程化
│ └── 05 课题常用工具包 ⭐⭐⭐⭐ 武器库
│
└── 支柱 B:生物统计(第 06 章)
└── 06 生物统计与实验数据分析 ⭐⭐⭐⭐⭐ 统计推断
依赖关系(必须按此顺序,不可跳级):
Python 基础语法 → NumPy → Pandas → 可视化/工程化 → 统计基础概念 → 假设检验 → 相关/回归 → 样本量估算
⚠注意
️ 不要跳过编程直接学统计。统计部分需要 Python 作为计算工具,第 06 章的所有代码示例都依赖第 01–03 章的知识。
3. 怎么学?—— 8 周时间规划
以下为建议节奏,每天保持 2–3 小时连续学习 + 动手敲代码。每周结束时完成对应交付物。
| 周次 | 内容 | 对应章节 | 周交付物 |
|---|---|---|---|
| 第 1 周 | 环境搭建 + Python 基础语法(变量、流程控制、函数) | 01 | 综合练习脚本 |
| 第 2 周 | Python 进阶(推导式、lambda、文件、异常、类) | 01 | 完善综合脚本 |
| 第 3 周 | NumPy 数值计算 | 02 | 模拟数据矩阵分析 |
| 第 4 周 | Pandas 数据读取与清洗 | 03 | 数据清洗报告(上) |
| 第 5 周 | Pandas 分组聚合、合并、透视表 | 03 | 数据清洗报告(下) |
| 第 6 周 | 包管理、Git、matplotlib/seaborn 可视化 | 04 + 05 | conda 环境 + Git 仓库 |
| 第 7 周 | 统计基础 + 正态性/方差齐性 + t 检验/ANOVA | 06 | 统计结果表 |
| 第 8 周 | 非参数检验、相关/回归、样本量估算 + 综合报告 | 06 | 完整统计报告 |
4. 学习方法与习惯
- 先动手,再理解:看到代码示例,先照着敲一遍、运行、观察输出,再回头读讲解。
- 报错是常态:遇到报错先自己读错误信息(最后一行通常是原因),再查文档,最后才问 AI——这是研究生阶段最重要的自学能力。
- 每学完一节,立刻做练习:练习不是可选项,是验收标准。
- 建立自己的速查笔记:把常用语法、易错点记在 Obsidian / Notion 里,与 Zotero 联动(见模块四)。
- 善用 AI 但保持批判:AI 可以帮你调试、解释报错,但必须能读懂 AI 给的代码,否则无法用于科研。
5. 环境搭建(第 1 周必做)
❞笔记
详细步骤见第 01 章「环境搭建」一节。这里给出最小清单:
| 工具 | 用途 | 安装方式 |
|---|---|---|
| Anaconda / Miniconda | Python 环境与包管理 | 官网下载安装包 |
| Jupyter Notebook / JupyterLab | 交互式写代码 | conda 自带 |
| VS Code | 代码编辑器 | 官网下载 + 安装 Python 插件 |
这三个工具分别是什么?(小白版)
- Python 本身 = 一台"发动机"。它是真正执行代码的引擎,但你平时看不到它。
- Anaconda = 一个"工具箱 + 仓库"。它把发动机(Python)和一堆常用工具(NumPy、Pandas 等)打包好,还帮你管理"装什么、卸什么"。
- Jupyter Notebook = 一本"能运行的草稿本"。每个格子写一段代码,按一下就能运行看结果,特别适合边学边试。
- VS Code = 一个"专业工作台"。写大段正式代码、调试程序时用,功能更强大。
版本建议(2026 年 8 月):
- Python 3.12 或 3.13(生态兼容性最好;3.14 已发布但部分第三方库尚未完全适配)
- NumPy 2.x、pandas 3.x、scikit-learn 1.9、statsmodels 0.14
- 安装命令:
conda create -n tcm_nano python=3.13,然后pip install numpy pandas matplotlib seaborn scipy scikit-learn statsmodels
📌要点
pandas 3.0 重要变化(2026 年 1 月发布):Copy-on-Write 成为默认行为(修改 DataFrame 不再意外改动原数据);字符串列默认使用 PyArrow 类型。本书代码已按新版本规范编写,若你使用 pandas 2.x,绝大多数代码仍可运行。
6. 模块一交付物总览
| 章节 | 交付物 | 验收标准 |
|---|---|---|
| 01 | 综合练习脚本 | 含基础语法、函数、文件读写、异常处理、简单类定义,全部加注释 |
| 02 | 模拟数据矩阵分析 | 10×5 矩阵,计算统计量并筛选,输出结果 |
| 03 | 科研数据清洗报告 | 读取→清洗→筛选→分组统计,输出清洗前后对比 + 干净 CSV |
| 04 | conda 环境 + Git 仓库 | 创建 tcm_nano 环境、生成 requirements.txt、完成一次 commit |
| 05 | 课题常用 Python 包速查表 | ≥8 个包,含用途、常用函数、科研示例 |
| 06 | 多组实验统计分析报告 | 统计结果表 + SCI 风格图 + 300 字方法描述 + G*Power 样本量估算 |
7. 学习资源速查
| 主题 | 推荐资源 | 类型 |
|---|---|---|
| Python 入门 | 黑马程序员 Python 零基础全套教程(B站) | 视频 |
| Python 查漏 | 廖雪峰 Python 教程 | 网页 |
| NumPy | 莫烦 Python 数据处理教程 | 视频 |
| Pandas | Pandas 零基础入门到精通教程(B站) | 视频 |
| 统计 | 见第 06 章各节配套资源 | — |
❞笔记
完整链接清单见同目录 HTML《学习资源补充手册》的「学习资源总表」。
下一章:01 · Python 基础语法