00 · 学习路径与总览

数据科学⭐⭐⭐⭐⭐核心必修 ⭐⭐⭐⭐|约 7 分钟8 节1 图
本章路线
模块一学习路径总览
图 00-1模块一学习路径总览
00 · 学习路径与总览

0. 小白导读:先用一句话听懂"模块一"是什么

如果你是零基础,先别被"数据科学""统计编程"这些词吓到。用大白话说:

  • Python(编程) = 一台"万能计算器 + 自动流水线"。你告诉它"怎么算、算哪些",它就能又快又准地帮你处理成千上万条数据,还能自动画图、自动重复操作。
  • 统计 = 一位"公正的裁判"。实验做完了,数据摆在那里,到底有没有差异、差异可不可信?统计就是帮你下这个判断的规则。
  • 两者合起来 = 你既会"算",又知道"怎么判断算得对不对"。这就是科研的基本功。
🍚生活化比喻

一个贯穿全书的比喻——做菜

  • Python 语法 = 认识锅碗瓢盆、学会开火(最基础的工具使用)

  • NumPy / Pandas = 学会切菜、洗菜、备料(把食材处理成能下锅的样子)

  • 统计 = 学会尝菜、判断咸淡是否合适(评价结果是否达标)

  • Git / 环境管理 = 学会保存菜谱、整理厨房(让过程可复现、不混乱)

后面每一章,我们都会用类似的比喻帮你"先听懂,再学会"。


1. 为什么必须先学数据科学与统计编程?

你未来的研究方向是中药纳米制剂、心脑血管疾病与抑郁共病、网络药理学,这三个方向有一个共同点:一切结论都建立在数据之上

  • 网络药理学:中药成分-靶点矩阵、蛋白互作网络、富集分析——本质是矩阵运算与统计分析。
  • 纳米制剂:粒径、包封率、释放曲线、细胞活力——本质是实验数据的统计比较(t 检验、ANOVA)。
  • 共病机制研究:行为学数据、生化指标、组学数据——本质是数据清洗、统计推断与可视化。

换句话说:Python 是工具,统计是语言。不会 Python,你的数据只能靠别人处理;不懂统计,你无法判断自己的结论是否可信。

🎯一句话总结

一句话总结:编程让你"能算",统计让你"算得对、说得清"。

再打个比方:想象你是一位厨师(研究者)。

  • 不会编程,就像没有菜刀和灶台——食材(数据)堆在那里,你只能干瞪眼。

  • 不会统计,就像不会尝味道——菜做出来了,但你不知道咸淡合不合适,端上桌(投稿)会被打回。

  • 两个都会,你才能独立完成"备料 → 烹饪 → 试味 → 上桌"的完整流程,也就是独立做科研。


2. 模块一学什么?

模块一包含两大支柱,共 7 个章节:

text
模块一 · 数据科学与统计编程
│
├── 支柱 A:Python 编程(第 01–05 章)
│   ├── 01 Python 基础语法          ⭐⭐⭐⭐⭐ 地基
│   ├── 02 NumPy 数值计算           ⭐⭐⭐⭐⭐ 矩阵运算
│   ├── 03 Pandas 数据处理          ⭐⭐⭐⭐⭐ 数据清洗
│   ├── 04 包管理与 Git             ⭐⭐⭐⭐  工程化
│   └── 05 课题常用工具包           ⭐⭐⭐⭐  武器库
│
└── 支柱 B:生物统计(第 06 章)
    └── 06 生物统计与实验数据分析   ⭐⭐⭐⭐⭐ 统计推断

依赖关系(必须按此顺序,不可跳级):

text
Python 基础语法 → NumPy → Pandas → 可视化/工程化 → 统计基础概念 → 假设检验 → 相关/回归 → 样本量估算
注意

不要跳过编程直接学统计。统计部分需要 Python 作为计算工具,第 06 章的所有代码示例都依赖第 01–03 章的知识。


3. 怎么学?—— 8 周时间规划

以下为建议节奏,每天保持 2–3 小时连续学习 + 动手敲代码。每周结束时完成对应交付物。

周次 内容 对应章节 周交付物
第 1 周 环境搭建 + Python 基础语法(变量、流程控制、函数) 01 综合练习脚本
第 2 周 Python 进阶(推导式、lambda、文件、异常、类) 01 完善综合脚本
第 3 周 NumPy 数值计算 02 模拟数据矩阵分析
第 4 周 Pandas 数据读取与清洗 03 数据清洗报告(上)
第 5 周 Pandas 分组聚合、合并、透视表 03 数据清洗报告(下)
第 6 周 包管理、Git、matplotlib/seaborn 可视化 04 + 05 conda 环境 + Git 仓库
第 7 周 统计基础 + 正态性/方差齐性 + t 检验/ANOVA 06 统计结果表
第 8 周 非参数检验、相关/回归、样本量估算 + 综合报告 06 完整统计报告

4. 学习方法与习惯

  1. 先动手,再理解:看到代码示例,先照着敲一遍、运行、观察输出,再回头读讲解。
  2. 报错是常态:遇到报错先自己读错误信息(最后一行通常是原因),再查文档,最后才问 AI——这是研究生阶段最重要的自学能力。
  3. 每学完一节,立刻做练习:练习不是可选项,是验收标准。
  4. 建立自己的速查笔记:把常用语法、易错点记在 Obsidian / Notion 里,与 Zotero 联动(见模块四)。
  5. 善用 AI 但保持批判:AI 可以帮你调试、解释报错,但必须能读懂 AI 给的代码,否则无法用于科研。

5. 环境搭建(第 1 周必做)

笔记

详细步骤见第 01 章「环境搭建」一节。这里给出最小清单:

工具 用途 安装方式
Anaconda / Miniconda Python 环境与包管理 官网下载安装包
Jupyter Notebook / JupyterLab 交互式写代码 conda 自带
VS Code 代码编辑器 官网下载 + 安装 Python 插件

这三个工具分别是什么?(小白版)

  • Python 本身 = 一台"发动机"。它是真正执行代码的引擎,但你平时看不到它。
  • Anaconda = 一个"工具箱 + 仓库"。它把发动机(Python)和一堆常用工具(NumPy、Pandas 等)打包好,还帮你管理"装什么、卸什么"。
  • Jupyter Notebook = 一本"能运行的草稿本"。每个格子写一段代码,按一下就能运行看结果,特别适合边学边试。
  • VS Code = 一个"专业工作台"。写大段正式代码、调试程序时用,功能更强大。
🍚生活化比喻

比喻:Anaconda 像"整装厨房"(锅碗瓢盆都配齐),Jupyter 像"试菜的小灶台"(随手炒一炒看味道),VS Code 像"正式后厨"(做大餐、管流程)。

版本建议(2026 年 8 月)

  • Python 3.12 或 3.13(生态兼容性最好;3.14 已发布但部分第三方库尚未完全适配)
  • NumPy 2.x、pandas 3.x、scikit-learn 1.9、statsmodels 0.14
  • 安装命令:conda create -n tcm_nano python=3.13,然后 pip install numpy pandas matplotlib seaborn scipy scikit-learn statsmodels
📌要点

pandas 3.0 重要变化(2026 年 1 月发布):Copy-on-Write 成为默认行为(修改 DataFrame 不再意外改动原数据);字符串列默认使用 PyArrow 类型。本书代码已按新版本规范编写,若你使用 pandas 2.x,绝大多数代码仍可运行。


6. 模块一交付物总览

章节 交付物 验收标准
01 综合练习脚本 含基础语法、函数、文件读写、异常处理、简单类定义,全部加注释
02 模拟数据矩阵分析 10×5 矩阵,计算统计量并筛选,输出结果
03 科研数据清洗报告 读取→清洗→筛选→分组统计,输出清洗前后对比 + 干净 CSV
04 conda 环境 + Git 仓库 创建 tcm_nano 环境、生成 requirements.txt、完成一次 commit
05 课题常用 Python 包速查表 ≥8 个包,含用途、常用函数、科研示例
06 多组实验统计分析报告 统计结果表 + SCI 风格图 + 300 字方法描述 + G*Power 样本量估算

7. 学习资源速查

主题 推荐资源 类型
Python 入门 黑马程序员 Python 零基础全套教程(B站) 视频
Python 查漏 廖雪峰 Python 教程 网页
NumPy 莫烦 Python 数据处理教程 视频
Pandas Pandas 零基础入门到精通教程(B站) 视频
统计 见第 06 章各节配套资源
笔记

完整链接清单见同目录 HTML《学习资源补充手册》的「学习资源总表」。


下一章:01 · Python 基础语法