• junchi@xremed.com

    • hongleili@xremed.com
    • 服务时间

    • 周一至周五 9:00-18:00
    • 微信二维码

阿里下场“AI 干细胞重编程”:400多万种组合的最优解,到底是谁“喂”出来的?

首页    新闻资讯    行业新闻    阿里下场“AI 干细胞重编程”:400多万种组合的最优解,到底是谁“喂”出来的?

7月14日,一条消息在生命科学圈刷屏:西湖大学与阿里巴巴达摩院联合发布了一款干细胞重编程预测AI模型——“归元”(ReproPerturb)。

据介绍,这款模型能从25种谱系调控因子(17种小分子药物+8种蛋白类生长因子)近400万种组合中,快速预测出诱导细胞进入目标干细胞状态的最优方案。团队据此在体外首次培育出可稳定传代超50代的高质量下胚层样干细胞。

达摩院资深算法专家顾斐在采访中提到一句话,我们看完印象很深:

“诱导干细胞命运转换,我们面对的是一个极其复杂的组合优化问题……如果都靠传统方式逐一实验验证,可能需要数十年时间,成本高,成功率也很低”。

400万种组合,数十年vs几个月,这确实是AI该做的事。但这条新闻里,还有一句更容易被忽略、却更重要的话:团队之所以能训练出这样一个模型,前提是“针对干细胞重编程构建了大规模组合扰动数据集”。

这句话,恰恰是我们想聊的重点。

 
 
 
 

01

归元的“聪明”,聪明在哪?

归元并不是一个凭空生成答案的黑盒子。公开信息显示,它采用了双模态编码策略:一边用分子结构表征小分子药物,一边用蛋白语言模型编码生长因子和细胞因子,把两类完全不同的信息统一投射到同一个高维空间里,再去预测不同组合对细胞命运的影响。

更值得关注的是,团队特意在模型里加入了可解释性模块,让预测结果能对应到已知的生物学信号通路上——AI不仅告诉研究者“哪个组合更可能有效”,还能解释“为什么有效”。

这套设计思路背后,其实藏着一个行业共识:能不能预测准,从来不是算法一个人的事,而是算法能不能吃到足够多、足够真实的数据。归元团队没有绕开这一步,而是先老老实实建了一套大规模组合扰动数据集,再在此基础上训练模型。换句话说,模型越聪明,背后往往站着一支同样扎实的数据团队。

 

 

02
这场AI+生物的军备竞赛,真正的瓶颈从来不是算法

把视角拉远一点看,会发现归元不是孤例。

Tahoe、Arc Institute、Biohub三方联手,目标是生成并开源迄今为止最大的单细胞扰动数据集——超1.2亿个单细胞数据点、覆盖约22.5万种扰动,明确说就是为了“填补虚拟细胞模型领域的数据空白”。Arc Institute自己训练的State、STACK等模型也反复印证同一个规律:模型的泛化能力,几乎完全取决于训练所用扰动数据的规模与多样性。

反观目前最常用的公共数据集L1000,每个profile实测的基因只有约978个,其余靠算法推断补全;覆盖的细胞类型也偏向少数几种常见的癌症细胞系。对于想要“全景、精准、可泛化”的下一代生命科学大模型来说,这样的数据燃料,纯度不够,也不够全。

一句话总结:这场表面上拼模型架构的竞赛,本质拼的是谁能更快、更便宜、更高质量地产出真实扰动数据。归元的出现,某种程度上又一次验证了这个判断——连阿里这样的大厂做AI模型,第一步依然是先花力气把自己的数据集搭起来。

 

03
昕瑞再生:我们一直在做的,正是这件事

如果说归元是“用AI预测干细胞状态该怎么设计”,那么昕瑞再生这几年一直在做的,是同一类问题在新药发现场景下的实践——只不过我们的目标细胞状态,不是“变成干细胞”,而是“从病理状态变回健康状态”。

支撑这一切的核心引擎,是昕瑞自主研发的DRUG-seq2高通量转录组测序技术:在96/384孔板中对每孔加药后的细胞做3′端条形码标记,混样后一次性高通量测序,再按条形码拆分,还原出每个处理条件下的全转录组指纹。单孔可检测10000—12000个基因的表达,孔间无交叉污染,与常规RNA-seq数据高度相关,相关技术与应用已见于《Nature Communications》《Cell Reports》《Cell Stem Cell》等期刊。

 

 

放在“数据燃料”的坐标系里看,DRUG-seq2的每一项参数,其实都是在补公共数据集(如L1000)的短板:读出基因数从978个提升到10000—12000个;细胞类型不再局限于常见癌系,原代细胞、类器官、患者样本均可适配;样本用量低至1000个细胞,成本和周期大幅下降,让上万化合物的大规模筛选变得可行。

这套引擎已经跑出过真实成果。在昕瑞内部自研的人皮肤瘢痕疙瘩治疗药物早期发现项目中,团队用DRUG-seq2从近万种小分子化合物中筛选,锁定先导分子FR-1。动物实验显示,FR-1能显著缩小瘢痕面积,效果优于经典解偶联剂FCCP,且首次揭示其通过“线粒体解偶联”逆转纤维化的作用机制。这项成果已于2026年发表在《Cell Reports Medicine》上。

从“近万种化合物”到“一个明确机制、疗效更优的先导分子”,靠的不是灵光一现,而是DRUG-seq2持续产出的真实扰动数据,加上团队的分析与验证能力——这正是“真实数据+AI/系统性筛选闭环”在中国的一次落地实践。

 

04
数据燃料,才是这场竞赛真正的护城河

无论是阿里的归元,还是我们的DRUG-seq2,本质上都在回答同一个问题:AI给出的那个“最优解”,究竟是谁喂出来的?

答案越来越清晰——不是更炫的架构,而是更真、更全、更持续产出的实测数据。

昕瑞再生愿意做这场变革里最扎实的那一环。未来,我们可以稳定实现月产10万条化合物-细胞转录组实测数据,依托海量实测数据集支撑AI模型训练,挖掘化合物与细胞状态的内在关联,搭建数字细胞体系,落地药物虚拟筛选,让“改写细胞命运”的新药,从中国的实验室加速走向临床、走向患者。

DRUG-seq2数据平台现已开放合作,欢迎制药企业、科研院所与AI团队携手,共启智能药物筛选新篇章。

 

 
联系我们
 

邮箱:xrzs-cx@xremed.com

官网:www.xremed.com

手机/微信:18936040318(微信昵称:昕小瑞)

 
关于昕瑞再生
炎炎夏日,是时候放下工作,带上孩子一起走进大自然了!我们特别策划了这场充满欢乐与惊喜的暑期亲子游活动,让您和孩子在山水之间共享美好时光,探索未知的世界,创造属于你们的独家记忆。

南京昕瑞再生医药科技有限公司成立于2019年,先后获中科创星、红杉资本两轮融资,依托北京大学分子医学南京转化研究院软硬件支持。公司核心团队源自北京大学,承载创始团队在干细胞、再生医学及小分子创新药领域20余年经验,搭建了世界领先的细胞表型药筛平台——整合细胞疾病模型、表型组学定量、AI技术,聚焦“细胞疾病/衰老表型逆转”研发新药。

公司拥有自主知识产权的DRUG-seq2、PHDs-seq高通量测序技术,已在早期药物开发、靶点发现、人工智能大模型建立等场景见效,既服务自研项目,也为科研领域提供高质量技术解决方案。

 

 

2026年7月21日 00:00
浏览量:0
收藏