文献解读 | ProteinTalks:让AI不只"认识"细胞,还能"预判"药效与联用【Nature】
2026-09-24
西湖大学郭天南团队联合DP Technology、北京大学等机构,构建了迄今为止规模最大的蛋白质组学扰动数据集,并开发了首个基于蛋白质网络动力学的AI基础模型ProteinTalks。该模型在药物疗效预测、联用协同筛选、耐药机制解析及临床预后分层等方面展现出强大的泛化能力,为"虚拟细胞"的构建和精准药物发现开辟了新范式。
一、研究背景
为什么要构建"虚拟细胞"?
虚拟细胞(Virtual Cell)是指对真实细胞的计算模拟模型,能够在计算机中预测细胞的生命过程和动态行为。构建一个可靠的虚拟细胞,需要对细胞内所有组分进行时间分辨的全面测量—而蛋白质网络是理解细胞生物学和疾病机制的核心。
然而,与转录组数据相比,大规模的蛋白质组学数据(尤其是包含动态时间信息的扰动数据)仍然极度稀缺。在药物发现领域,如果仅针对单个蛋白质靶点进行干预,而不考虑其在蛋白质网络中的上下文关系,往往会导致疗效有限或产生非预期的副作用。因此,系统性地分析和建模蛋白质组的动态变化,对于识别新药物靶点、设计更精准的治疗方案以及最终构建完整的虚拟细胞模型至关重要。
近年来,数据非依赖采集质谱(DIA-MS)技术的进步使得高通量蛋白质组学成为可能,为利用大规模预训练技术描述蛋白质动态空间铺平了道路。本研究正是在这一技术背景下,迈出了关键一步。
二、数据规模
迄今最大的扰动蛋白质组学数据集
研究者以乳腺癌细胞系为研究对象,构建了一套多维度的扰动蛋白质组学实验体系:


质量控制分析显示,生物学重复和技术重复之间具有高度一致性(Pearson相关系数中位数r=0.95,CV中位数0.15-0.16),验证了数据的高可靠性。该数据集命名为ProteinTalks Datasets (PTDS),已在 db.prottalks.com 开放获取。
三、模型架构
ProteinTalks:首个蛋白质组动力学基础模型
基于上述大规模数据,研究团队开发了名为 ProteinTalks 的动力学基础模型。该模型的核心创新在于将神经常微分方程(Neural ODE)与扰动感知神经网络相结合,首次将时间维度显式地整合到基础模型的架构之中。
ProteinTalks 双模块架构
1)动力学预测模块(Module-1)
输入未扰动蛋白质组 + 药物靶点信息 → 编码器 → Neural ODE(rk4求解器)→ 预测6h/24h/48h扰动蛋白质组 → 与真实数据计算MSE损失(Loss₁)。该模块负责学习蛋白质网络的动态变化规律。
2)药效预测模块(Module-2)
输入预测的扰动蛋白质组 + 药物分子指纹(881维DMF)+ 药物理化性质(55维DDP)+ 药物靶点 → MLP → 预测药物疗效和组合协同性 → BCE损失(Loss₂)。该模块负责识别与药物响应相关的核心蛋白质。
3)多任务学习策略
通过梯度余弦相似度动态调整Loss₁与Loss₂的权重(λ=0.8),当梯度方向冲突时优先保障药效预测任务,避免任务间的梯度竞争。

与现有模型的关键区别:AlphaFold解决的是蛋白质结构预测问题,Geneformer/scGPT基于单细胞转录组数据。ProteinTalks是首个将大规模蛋白质组学扰动数据与时间动力学信息整合的基础模型,在预测蛋白质网络动态方面填补了空白。
四、药物疗效预测
超越传统机器学习模型的预测能力
ProteinTalks在药物疗效预测任务上展现了显著优于传统机器学习模型的性能:在 held-out、跨细胞系、跨药物、未训练新药 PTNC和跨癌种 PTPC中均优于转录组基础模型。
- 同分布 held-out:Accuracy 0.86,AUROC 0.92,AUPRC 0.84 。
- 留一细胞系:17 个乳腺癌细胞系上 AUPRC 0.89、AUROC 0.95,转录组模型被明显包住。
- 留一药物:对训练时没见过的 MOA 仍有正迁移。
- 完全未训练新药 PTNC:81 个新抗癌药上 AUPRC 0.94 / AUROC 0.89 / Acc 0.85,而 Geneformer 几乎降到随机水平。
- 跨癌种 PTPC:黑色素瘤、肠癌、肺癌、胰腺癌 few-shot 后仍优于所有转录组基线。

五、药物联用预测
在药物联用预测中,ProteinTalks将双药分子特征与蛋白动态上下文融合,成功区分协同与非协同组合,并指导湿实验验证了 bosutinib+tucatinib / bosutinib+abemaciclib 等在 TNBC 细胞系中的强协同效应,从而把一个“虚拟细胞模型”变成可用来筛药、提假设、做精准用药推荐的 operational tool。

六、可解释性
SHAP值揭示耐药关键蛋白
ProteinTalks的可解释性是其重要优势之一。通过计算SHAP(SHapley Additive exPlanations)值,研究者能够量化每个蛋白质对药物敏感性预测的贡献度,从而识别出与耐药相关的核心蛋白质。
通路层面的解读
具有相似作用机制(MOA)的药物在SHAP通路热图上呈现出相似的模式。例如:DNA修复通路对烷基化剂的敏感性预测至关重要;PI3K-AKT-mTOR通路是PI3K/AKT抑制剂响应的核心;雌激素响应通路在芳香化酶抑制剂中占据主导地位。

关键耐药蛋白的实验验证
AKR1C3激素类药物 & 激酶抑制剂的关键蛋白
SHAP值最高的蛋白之一。研究人员使用小干扰RNA(siRNA)在BT20细胞中敲除AKR1C3,并通过细胞毒性实验评估其对多西他赛的反应。通过质谱分析确认了敲除效率。细胞毒性实验表明,AKR1C3的敲除增强了BT20细胞对多西他赛的敏感性(Δln[IC50] = 4.24),支持AKR1C3作为由ProteinTalks优先筛选出、与多西他赛反应相关的蛋白质。
意义:ProteinTalks不仅能预测"药物是否有效",更能回答"为什么有效/无效"——通过SHAP分析定位到具体的蛋白质和通路,为后续的实验验证和机制研究提供了精确的靶点。
七、临床转化
从细胞系到患者:迈向精准医疗
迁移学习:蛋白质组→转录组的跨模态增强
研究团队进一步探索了ProteinTalks在患者来源肿瘤异种移植(PDX)模型中的应用。通过在蛋白质组数据上预训练后对转录组数据进行微调(迁移学习),模型在PDX数据集上的药物疗效预测性能显著提升:

八、核心启示
这项研究带来了什么?
1)数据规模突破:3800万条蛋白质扰动测量是迄今最大的蛋白质组学扰动数据集,为AI驱动的蛋白质组学研究奠定了数据基础。
2)首个动力学基础模型:ProteinTalks首次将时间维度显式整合到蛋白质组基础模型中,突破了以往模型仅基于稳态数据的局限。
3)药物发现新范式:模型在单药疗效预测(AUROC 0.96)、联用协同筛选(4/4实验验证成功)和耐药蛋白识别方面均展现出实用价值。
4)可解释性优势:SHAP分析使模型从"黑箱"走向"透明",能够精确定位驱动药物响应和耐药的关键蛋白质与通路。
5)临床转化路径:通过迁移学习,蛋白质组预训练模型可有效增强转录组数据的预测能力,并在真实患者队列中验证了预后分层价值。
6)"虚拟细胞"的重要一步:本研究证明,有限的大规模扰动测量结合动力学AI模型,可以构建跨越时间和空间的虚拟细胞模型框架。
九、未来展望
随着蛋白质组深度和通量的进一步提升,以及PTMs数据的整合,ProteinTalks框架有望扩展为更加完整的"虚拟细胞"模型,覆盖更多疾病类型和生物学过程。
参考文献链接:
https://www.nature.com/articles/s41586-026-11001-9
2026 /
09-24
所属分类:
行业新闻
新闻资讯
相关资讯—
2026-09-24
