COURSE
课程总览:两天 8 节课
Day 1 建立概念骨架,Day 2 建立判断力。时间不够就只做 S7 和 S8——那两节是判断力的来源,前面的概念可以随时回头查。
DAY 1 · 从零到看懂数据
今天不碰 AI,只搞清楚三件事:这些分子是什么、「结合」是怎么回事、数据长什么样。
今天结束时你应该能:打开一份抗原-抗体数据表,
逐列说出每一列是什么意思、为什么存在、缺了它会怎样。
S1 · 上午 · 90 min分子的「数据类型」
蛋白质是 20 个字母的字符串;抗体是 4 条链的复合对象;可变区是实例字段;
CDR 是决定行为的那几个子串。
S2 · 上午 · 60 min「结合」就是两个对象的匹配
抗原 ≠ 表位 ≠ 互补位;线性表位 vs 构象表位;KD 数量级速查;
SPR / BLI / ELISA 各自的可信度。
S3 · 下午 · 90 min数据格式与标识符
FASTA 与 PDB;IMGT / Kabat / Chothia 三套编号体系的真实差异;
为什么靶点必须归一到 UniProt 登录号。
S4 · 下午 · 60 min动手:把今天学的跑一遍
Lab 1 打开一条真实记录逐字段对照概念;Lab 2 用 GROUP BY 的思路给整份数据做体检。
DAY 2 · 从数据到判断力
今天讲 AI 在这里做什么、这门生意的真实形态,以及最重要的——怎么判断一份数据的好坏。
今天结束时你应该能:
拿到任何一份这类数据,在 5 分钟内做出可靠的初步判断,并问出 3 个让对方答不上来的问题。
S5 · 上午 · 60 minAI for Science 在这里做什么
AlphaFold 的贡献与边界;用函数签名理解三类任务;
为什么瓶颈是数据不是模型。
S6 · 上午 · 60 min数据工程的真实形态
四层能力:多源接入 → 实体归一 → 证据判定 → 信息抽取。
外加五个真实的坑。
S7 · 下午 · 90 min · ★ 全课核心质量与证伪
四个实验,每个都让你亲手把 bug 跑出来:词边界假阳性、别名劫持、
从结构实算表位、断言式质检。
S8 · 下午 · 60 min判定与商业
三维验收标准、十个必问问题、五分钟自助抽查、红旗清单。
可以直接抄进合同。
三条学习路径,按你有多少时间选
A完整两天(约 10 小时)
按 S1 → S8 顺序走完,每节做当堂自测,六个实验全跑。 最后做结业考试 20 题,16 题以上算过关。
适合:你要长期跟这个领域打交道——要做这方面的项目、要招这方面的人、 或者要判断要不要进这个赛道。
你需要准备什么
环境
一个 Python 3.10+ 环境就够了。四个实验完全离线可跑, 两个需要联网(会真的去请求 HGNC 和 UniProt 的公开 API)。
$ git clone https://github.com/Runix-lab/ai4s-for-programmers $ cd ai4s-for-programmers $ python3 -m venv .venv && source .venv/bin/activate $ pip install -r labs/requirements.txt $ python labs/lab1_read_one_record.py
详细说明见 实验页。
前置知识
- 需要:会写 Python,理解主键 / 外键 / schema / 单元测试这些概念。
- 不需要:任何生物学、化学背景。真的一点都不需要。
- 不需要:机器学习基础。这门课不教建模。