数药智库

跨疾病靶点数据平台 —— 让 AI 制药的数据准备,从几周缩短到几分钟

📌 我们做什么

AI 制药的瓶颈不在算法,在数据。研究团队往往要花费 50% 以上的时间 在手动整理、清洗、对齐分散在多个数据库中的靶点数据——而这恰恰是计算机最擅长的部分。

数药智库 将 Open Targets、UniProt、PDB、TTD 四个权威数据源整合为 一个标准化、可搜索、可下载的靶点数据层,让研究人员把时间花在真正的科学发现上, 而不是数据清洗上。

🔬 我们的数据来源

我们不做数据生产,我们做数据的整合、清洗和交付。所有原始数据均来自以下权威平台。

🎯

Open Targets

靶点-疾病关联的权威证据平台。整合遗传学、文献、表达数据等多维度证据。

platform.opentargets.org →
🧬

UniProt

全球最权威的蛋白质序列与功能信息资源。提供氨基酸序列、功能注释等。

www.uniprot.org →
🏗️

RCSB PDB

全球唯一的生物大分子三维结构数据库。存储科学家解析的蛋白质 3D 结构。

www.rcsb.org →
💊

TTD

治疗靶点数据库(浙江大学维护)。提供成药性、PPI互作、miRNA调控、生物通路等多维数据。

db.idrblab.net/ttd →
🧫

DepMap

癌症依赖图谱。提供全基因组CRISPR筛选数据,识别癌细胞的遗传脆弱性。

depmap.org →
🔗

STRING

蛋白质互作网络数据库。整合实验、文献、共表达等多种证据,覆盖12500+物种。

string-db.org →
🗺️

Human Protein Atlas

人类蛋白质图谱。提供蛋白质在40+正常组织中的表达和分布数据。

proteinatlas.org →
🧪

ChEMBL

化合物-靶点活性数据库。包含240万+化合物和2000万+生物活性记录。

ebi.ac.uk/chembl →
📦

InertDB

惰性化合物数据集。AI模型训练用的负样本,包含实验验证和AI生成的惰性化合物。

github.com/.../InertDB →

✨ 数药智库 做了什么

🔗

跨源整合

将四个数据库的数据通过 UniProt ID 和基因符号对齐, 输出一张可 JOIN 的统一数据表。

🏷️

别名归一

处理 HER2 / ERBB2 / neu 是同一个基因的情况。 用户搜任何一个名字都能命中。

🧹

标准化清洗

去重、缺失标记、单位统一、格式规范化, 输出 ML-Ready 数据集。

📦

一键交付

下载包含主表、数据字典、序列、PDB列表、 质量报告的完整 ZIP 包,可直接用于模型训练。

🔄

持续更新

上游数据源更新后,平台数据同步刷新, 用户始终能拿到最新的靶点信息。

🎯 适合谁用

🧪

学术实验室

靶点发现、疾病机制研究,快速获取 ML-Ready 数据

💊

AI 制药公司

训练靶点预测模型、虚拟筛选,节省 60% 数据准备时间

🔬

药物研发团队

快速评估靶点成药性,参考在研药物和临床阶段

📊

数据科学家

无需处理多源异构数据,直接拿到标准化的结构化数据集

🤝 合作方式

数据下载(免费)

注册账号后可下载任意疾病的数据层 ZIP 包,用于学术研究。

定制疾病数据层

平台未收录的疾病,可联系我们定制采集和整合,按项目交付。

数据源合作

如果你有私有靶点数据(CRO、实验室、Biotech), 可以合作整合到平台,触达更多用户。

API 接入

将 数药智库 的数据查询接口集成到你的模型训练管道, 实现自动化数据拉取。

📬 联系我们

有需求、有建议、想合作,都欢迎联系

✉️ 发送邮件 🐙 GitHub

数药智库 不生产数据,只整合和交付公开的权威数据。

平台数据仅供科研使用,不构成任何医疗或投资建议。

数据来源:Open Targets · UniProt · RCSB PDB · TTD