技术专栏

理解 AI 制药:
数据为什么是最难的一环

这篇文章用最直白的方式,讲清楚 AI 制药需要什么数据、这些数据干什么用、以及 数药智库 如何把这些数据变成可决策的靶点报告。

1. 靶点是什么?

在讲数据之前,先理解一件事:AI制药在"研究什么"。

你身体里有几万种蛋白质,它们像机器一样维持生命运转。但当某个蛋白质出了问题(过度活跃、异常表达、突变),就会导致疾病。

这个"出问题的蛋白质",就是靶点(Target)。药物研发的目标,就是设计一种分子(小分子、抗体、RNA药物等)去"修复"或"阻断"这个蛋白质。

💡 类比:靶点是一把"锁",药物是一把"钥匙"。钥匙能精确插入锁里,就能控制锁的功能。
AI制药要做的:找到正确的锁,并设计出能打开它的钥匙。

2. 药物发现的全流程

从"疾病"到"上市药物",需要经过这样的步骤:

🎯 找靶点
→
🔬 验证靶点
→
🧬 设计分子
→
🧪 湿实验验证
→
💉 临床试验
→
✅ 上市

蓝色节点是"干实验室"环节(用计算机做),黄色节点是"湿实验室"环节(用真实试剂做)。

传统方式,一个药物从0到上市平均需要 10-15年,耗资 10-26亿美元,而90%以上的候选药物会在临床阶段失败。

💡 关键矛盾:干实验室一天能筛选几百万个分子,但湿实验室一个月只能验证几百个。 如果盲目试错,永远试不完。所以需要AI来"预判"哪些最可能成功,把宝贵的湿实验资源用在最有希望的候选上。

3. 为什么数据是最难的一环?

很多人以为AI制药的瓶颈是"算法"。但现实恰恰相反:算法是公开的,算力可以租,只有数据是稀缺的。

数据难在哪?三个层面:

① 数据分散在几十个数据库里

你研究一个靶点,需要从Open Targets查疾病关联、去UniProt找蛋白序列、去PDB找3D结构、去TTD查成药性、去DepMap看CRISPR筛选…… 每个数据库格式不同、命名不同、更新频率不同。

② 命名混乱

同一个基因,有人叫 HER2、有人叫 ERBB2、有人叫 NEU、有人叫 CD340。 程序要做字符串匹配,一不小心就匹配错了。

③ 数据质量参差

公共数据库里有实验数据、有AI预测数据、有文献报道、有自动注释。哪些可信、哪些是噪声,需要专业判断。

📊 行业共识

生物医药领域的研究者,平均花费 50%-60% 的时间在手动整理和清洗数据上,而不是在真正的科学发现上。

4. 十大数据源全景

数药智库 整合了 10 个权威数据源,每个数据源回答 AI 制药中的一个关键问题。

🎯

Open Targets · 靶点-疾病关联

数据来源:Sanger Institute + EMBL-EBI 更新:季度

回答:"哪些蛋白质和这个疾病有关?" 它整合遗传学、文献、表达等多维证据,为每个"靶点-疾病"组合打出一个综合评分。 评分≥0.5的靶点,通常被认为有足够的研究价值。

🧬

UniProt · 蛋白质序列与功能

数据来源:EMBL-EBI + SIB + PIR 更新:月度

回答:"这个蛋白质长什么样?" 提供蛋白质的氨基酸序列(就是20种氨基酸组成的字符串)、功能注释、变异信息。 是AI模型的"基础输入"——因为蛋白质序列决定了它的形状和功能。

🏗️

PDB · 蛋白质3D结构

数据来源:RCSB 更新:周度

回答:"这个蛋白质的形状是什么?" 存储科学家用X射线、冷冻电镜等方法解析出的3D结构。 有了结构,才能做分子对接——把候选药物分子"塞"进蛋白质的口袋里,看能不能匹配。

💊

TTD · 成药性与调控网络

数据来源:浙江大学 更新:两年一次

回答多个问题:
• "有人做过这个靶点的药吗?" → 成药性评估
• "它和谁一起工作?" → PPI互作网络
• "谁在调控它?" → miRNA调控
• "它参与哪些信号通路?" → 生物通路

🧫

DepMap · CRISPR基因筛选

数据来源:Broad Institute 更新:季度

回答:"如果敲除这个基因,癌细胞会死吗?" 用CRISPR技术逐个敲除癌细胞中的基因,看细胞是否还能存活。 如果某个基因敲除后癌细胞死了,说明它是"必需基因"——但同时,作为靶点可能有毒性风险,因为正常细胞也需要它。

🔗

STRING · 蛋白质互作网络

数据来源:瑞士 SIB + 多所大学 更新:年一次

回答:"这个蛋白质和谁有关系?" 整合实验、文献、共表达等证据,构建了一个超级大的蛋白质"社交网络"(超过200亿对关系)。 通过它,可以找到靶点上下游的调控关系,也可以发现新的潜在靶点。

🗺️

HPA · 人体组织分布

数据来源:瑞典 KTH 更新:年一次

回答:"这个蛋白质在人体的哪些组织表达?" 如果靶点只在病变组织高表达、在正常组织不表达,那么针对它做药就有"治疗窗口"。 反之,如果它在心脏、肝脏等重要器官也高表达,那么药物可能有严重副作用。

🧪

ChEMBL · 化合物活性数据

数据来源:EMBL-EBI 更新:年一次

回答:"有什么分子能作用于这个靶点?" 人工从文献中提取的化合物-靶点活性数据(IC50、Ki等)。 这些是AI训练的"正样本"——让模型知道"什么样的分子能结合靶点"。

📦

InertDB · 惰性化合物(负样本)

数据来源:学术开源项目 更新:年一次

回答:"什么样的分子没活性?" AI模型需要"正样本"(有活性)和"负样本"(无活性)才能学会区分。 InertDB提供了6.7万个"实验证明无活性"的化合物,填补了负样本的空白。

🎯

Open Targets 26.09 · 可成药性画像 🆕

数据来源:Sanger + EMBL-EBI 更新:季度 NEW

回答三个维度的问题:
• "能做药吗?" → 4 种模态可及性(小分子 / 抗体 / PROTAC / 其他)
• "是必需基因吗?" → CRISPR 组织筛选
• "有没有安全性事件?" → 已知不良事件库
这三层证据是"能否成药 + 会不会毒"的核心。

🧪

ClinicalTrials.gov · 全球临床试验 🆕

数据来源:美国 NIH 更新:日度 NEW

回答:"这个靶点竞争激烈吗?" 从已上市药物的名称反查全球临床试验,聚合出每个靶点的试验总数。 ≥ 1000 项 = 红海,< 20 项 = 蓝海机会。 客户立项时最先看的就是这个——"红海里的靶点,我们要不要差异化?"

5. 数据之间的关系

这些数据不是独立的,它们通过基因符号(Gene Symbol)和UniProt ID串联成一张网。

数据源 提供什么 回答的问题
Open Targets 靶点-疾病关联评分 这个靶点和疾病有关吗?
UniProt 蛋白序列 + 功能 它长什么样?
PDB 3D结构 它的形状是什么?
TTD 成药性 + PPI + miRNA + 通路 有人做过药吗?和谁协作?
DepMap CRISPR筛选 敲除后会死吗?毒性风险?
STRING 蛋白互作网络 它的社交圈有多大?
HPA 组织分布 在哪些组织表达?有副作用吗?
ChEMBL 化合物活性 有什么分子能作用于它?
InertDB 负样本化合物 什么样的分子没活性?
Open Targets 26.09 🆕 可成药性画像 + 必需性 + 安全性 能做药吗?是必需基因吗?有什么不良事件?
ClinicalTrials.gov 🆕 全球临床试验 竞争激烈吗?红海还是蓝海?
💡 类比:想象你在评估一个员工(靶点)。
• Open Targets 告诉你"他适不适合这个岗位"
• UniProt 告诉你"他的简历"
• PDB 告诉你"他的长相"
• TTD 告诉你"他以前有没有被录用过、和谁一起工作过"
• DepMap 告诉你"如果开除他会怎样"
• STRING 告诉你"他的社交圈"
• HPA 告诉你"他平时在哪里活动"
• ChEMBL 告诉你"哪些管理方式对他有效"
• InertDB 告诉你"什么样的管理方式对他无效"
• Open Targets 26.09 告诉你"他能不能胜任、有没有隐患"
• ClinicalTrials.gov 告诉你"有多少公司在抢这个岗位"

6. 数药智库 做了什么?

数药智库 不做数据生产——所有原始数据都来自上述权威平台。我们做的是:

① 跨源整合

把分散在10个数据库里的数据,通过统一的基因ID对齐,输出一张可以JOIN的表。 用户不用再分别去10个网站下载、清洗、对齐。

② 别名归一

把 HER2、ERBB2、NEU、CD340 识别为同一个基因。 用户搜任意一个名字,都能命中。

③ 标准化清洗

单位统一、缺失值标记、去重、格式规范化。输出ML-Ready的数据集——用户拿到就能直接喂给模型。

④ 一键交付

按疾病打包,包含数据表、数据字典、质量报告、序列、3D 结构。一个 ZIP,开箱即用。

⑤ 多维评分 🆕

9 维度加权评分(TTD 成药性 25% + 可成药性画像 15% + CRISPR 15% + 必需性 10% + 组织分布 10% + 3D 结构 8% + 活性化合物 7% + 安全性 5% + 网络 5%), 输出 A/B/C/D 四级风险分层。所有靶点用同一套标尺横向对比。

⑥ 竞争格局分析 🆕

基于 ClinicalTrials.gov 的临床试验数,自动分析每个靶点是"红海"还是"蓝海"。 客户做立项时一眼就能看出"这个方向还有没有机会"。

⑦ 可定制评分 🆕

5 种预设标准(标准 / 安全性优先 / 数据驱动 / 抗体 / 小分子), 客户可根据研发偏好重新排序。同一个疾病,不同团队看到不同答案。

🎯 一句话定位

数药智库 是"靶点决策平台"——不仅整合 10 个数据源、13 层证据, 还回答"该不该做、能不能做、会不会毒、竞争如何", 输出可直接用于立项、BD 尽调、管线复盘的量化报告。

7. 一句话总结

AI 制药的瓶颈不在算法,在数据。

一个靶点值不值得做药,需要从 13 层证据回答:
它和疾病有关吗?长什么样?什么形状?
有人做过吗?能做药吗?是必需基因吗?
敲除会死吗?和谁协作?在哪表达?
什么分子有效?什么分子无效?
有什么不良事件?竞争激烈吗?

数药智库 把这 13 层证据整合成一份决策报告。

想实际看看这些数据?

搜索任意靶点,查看它 13 层证据的完整画像。

开始搜索