为什么生物数据在人工智能药物发现中更重要 - AI News
为什么生物数据在人工智能药物发现中更重要

为什么生物数据在人工智能药物发现中更重要

2026-08-03

新闻要点

GSK 与英国生物技术公司 Relation Therapeutics 达成价值最高 1.1 亿美元的合作,扩展 AI 辅助药物发现工作,Relation 将生成人类细胞对基因变化和药物干预反应的大规模数据集,用于训练 AI 模型识别潜在药物靶点,该合作强调生物数据生成与 AI 模型开发并重。研究显示单细胞基础模型并非数据越大越好,需平衡模型能力、数据规模和计算资源。

- GSK 与 Relation 合作,金额最高 1.1 亿美元扩展 AI 药物发现

- Relation 通过 Lab-in-the-Loop 生成生物数据训练 AI 模型

- 单细胞基础模型数据规模并非越大越好需平衡资源

- 公共生物数据存在噪音、冗余等技术挑战

主要内容

GSK与英国生物技术公司Relation Therapeutics达成最高1.1亿美元的AI辅助药物发现研究合作,将扩展双方现有合作。根据协议,Relation将生成人类细胞对基因变化和药物干预反应的大规模数据集,用于训练AI模型识别潜在药物靶点,包括其MORGAN平台内的模型。

合作基于双方早期在纤维化疾病和骨关节炎领域的研究,通过Lab-in-the-Loop平台生成功能疾病数据集,结合人类遗传学、单细胞多组学、功能检测及机器学习识别验证靶点。

Relation采用“Lab-in-the-Loop”方法,整合实验室实验与计算分析,包括组织图谱、单细胞/空间转录组学、测序、扰动实验等,机器学习用于靶点识别、优先级排序和实验设计。

公共数据库(如CZ CELLxGENE、人类细胞图谱、NCBI基因表达综合数据库)是生物基础模型训练的重要材料,但存在技术挑战:研究方法差异、数据重叠、技术噪声等。2025年《Experimental & Molecular Medicine》指出,高质量非冗余数据集与模型架构同等重要。

2024年6月《Nature Methods》研究(基于2220万个细胞)发现,模型性能在数据量达到一定程度后停滞,需平衡模型容量、数据量和计算资源,而非单纯增加数据。