AI虚拟细胞站上风口,真正稀缺的是什么?真实扰动数据,才是生命科学大模型的「硬通货」
从虚拟细胞到AI靶点发现,整条赛道都在抢同一种资源;DRUG-seq2,正是连接真实细胞与数字模型的那座数据桥梁。
这半年,「AI+生物」彻底火了。
AI虚拟细胞(AI Virtual Cell)被《自然》列为最值得期待的科技突破之一;生命科学大模型、AI药物发现、AI靶点与生物标志物挖掘接连刷屏;监管端,美国NIH已宣布不再资助仅依赖动物实验的新研究项目,FDA也在加速推动「去动物化」的人源模型评价路线。资本同样疯狂下注——抗衰老重编程公司NewLimit一轮就融了4.35亿美元。
所有人都在谈「模型」。但很少有人追问一个更朴素的问题:这些越来越聪明的模型,到底吃什么长大?

一
热闹背后,整条赛道都卡在同一个瓶颈:数据
把当下的AI+生物拆开看,其实只有两类角色:「预测器」和「燃料」。
预测器,就是各种虚拟细胞模型、生命科学大模型——它们负责学习「化合物 → 细胞状态」的映射,输出靶点预测、药效预测、毒性预测。算法、架构、算力,是这一侧的竞争点。
燃料,则是喂给模型的大规模、高质量、真实的扰动转录组数据。没有足够规模与多样性的真实数据,再精巧的架构也只是「空转的引擎」。
而今天真正稀缺、真正卡脖子的,恰恰是后者。这一点,行业里的头部玩家已经用真金白银投票了:
Tahoe、Arc Institute、Biohub三方联手,目标是生成并开源迄今最大的单细胞扰动数据集——超1.2亿个单细胞数据点、覆盖约22.5万种扰动,明确就是为了「填补虚拟细胞模型领域的数据空白」。
Arc Institute的State、STACK等模型反复印证:模型的泛化能力,几乎完全取决于训练所用扰动数据的规模与多样性。
一句话总结:这场AI+生物的军备竞赛,表面拼模型,本质拼数据。谁能更快、更便宜、更高质量地产出真实扰动数据,谁就握住了整条价值链最上游的咽喉。
二
为什么必须是「真实实验数据」?
有人会问:现在合成数据、虚拟标签这么发达,模型自己「脑补」一些数据不行吗?
答案是:可以辅助,但永远替代不了真实实测数据。原因有三:
Garbage in, garbage out
模型学到的因果规律,上限由训练数据的真实性决定。用充满假设与噪声的合成数据训练,只会让模型在「自己编的世界里」越来越自信,却在真实细胞面前失灵。
拟标签需要真实数据来「校准」
主动学习、闭环优化这类前沿范式,每一轮都依赖真实湿实验反馈来修正模型方向——没有真实数据节点,闭环就闭不上。
泛化靠多样性,多样性靠真实场景
癌症细胞系的数据再多,也预测不准原代细胞、类器官、患者样本的真实反应。模型要走向临床,就必须吃到这些「难培养、高价值」的真实扰动数据。
这也正是当前最尴尬的现实:现有公共数据(如L1000)虽规模可观,但每个profile仅实测约978个基因,其余靠推断;细胞类型也偏向常见癌系。对于追求「全景、精准、可泛化」的下一代生命科学大模型而言,这样的「燃料」既不够纯,也不够多。
三
DRUG-seq2:为生命科学大模型量身打造的「数据工厂」
昕瑞再生自主研发的DRUG-seq2,是一种少量细胞、高通量的批量化3′ 端转录组测序技术。它在96/384孔板中对每孔细胞批量加药,直接裂解、用孔特异Barcode标记后混样,一次测序即可还原每一孔的全转录组表达谱。
放到「数据燃料」的视角,DRUG-seq2的每一项特性,都精准命中了AI模型的真实需求:
|
维度 |
公共数据/L1000等 |
DRUG-seq2 |
|
基因读出 |
约978基因(其余推断) |
10,000–12,000基因,全景实测 |
|
样本用量 |
常规RNA-seq需大量细胞 |
低至1,000个细胞/样本 |
|
细胞类型 |
偏常见癌系 |
原代细胞/类器官/患者样本均适配 |
|
单样本成本 |
较高 |
较低 |

四
真实数据的力量,已被反复验证
「真实数据决定模型上限」不是一句口号。下面这几个真实案例,恰恰说明了高质量实测扰动数据的价值。
药筛大模型的「数据燃料」:DrugReflector(Science)
发表于《Science》的主动强化学习模型DrugReflector,训练于百万级药物扰动转录数据。靠着足够规模与多样性的数据,它在基准测试中较传统算法平均召回率提升15倍以上;在血液疾病筛选中,把巨核细胞分化命中率提升17倍、红系祖细胞分化命中率提升13倍。
但论文也坦承一个软肋:当依赖癌症细胞系数据时,模型在原代细胞上的表现会下降。这正是DRUG-seq2的用武之地——它能快速补充原代细胞、疾病特异性细胞的真实扰动数据,为模型补上最缺的那块「燃料」,也为虚拟标签提供实测校准依据。DRUG-seq2的全转录组实测(约12,000 基因/profile),相比L1000的978基因,能提供更纯的预训练数据与更精准的闭环反馈。
肝毒性 AI 大模型:ToxPredictor
一项《Nature Communications》研究构建了大规模毒性转录组数据库与预测框架ToxPredictor,盲测中达到88% 灵敏度、100%特异性,并提前识别出多款在临床三期因肝毒性折戟、却被动物实验漏判的候选药。它的底座,正是药物扰动转录组数据。而要把这样的数据库做大做快,DRUG-seq2「仅需1000细胞、免RNA提取、成本更低」的优势,恰是更优解。
真实新药产出:抗皮肤瘢痕候选分子FR-1(Cell Reports Medicine)
在昕瑞再生参与的研究中,团队用DRUG-seq2对近万种小分子做化学扰动筛选,锁定先导分子并优化出候选药FR-1,首次揭示其通过「线粒体解偶联」逆转纤维化的全新机制,动物实验中药效优于临床常用药曲安奈德。相关成果于2026年发表在《Cell Reports Medicine》。从筛选到成药,DRUG-seq2是这条研发链的起点与底层引擎。

当全球都在抢「AI虚拟细胞」的风口,真正稀缺的从来不是聪明的模型,而是足够多、足够真、足够全的实验数据。
昕瑞再生愿做这场变革里最扎实的那一环——以DRUG-seq2为桨,把真实的细胞世界,源源不断地输送给数字的智能世界。
DRUG-seq2×虚拟细胞平台现已开放合作,欢迎制药企业、科研院所与医疗机构携手,共启智能药物筛选新篇章。
联系我们
邮箱:xrzs-cx@xremed.com
官网:www.xremed.com
手机/微信:18936040318(微信昵称:昕小瑞)

关于昕瑞再生
南京昕瑞再生医药科技有限公司成立于2019年,先后获中科创星、红杉资本两轮融资,依托北京大学分子医学南京转化研究院软硬件支持。公司核心团队源自北京大学,承载创始团队在干细胞、再生医学及小分子创新药领域20余年经验,搭建了世界领先的细胞表型药筛平台——整合细胞疾病模型、表型组学定量、AI技术,聚焦“细胞疾病/衰老表型逆转”研发新药。
公司拥有自主知识产权的DRUG-seq2、PHDs-seq高通量测序技术,已在早期药物开发、靶点发现、人工智能大模型建立等场景见效,既服务自研项目,也为科研领域提供高质量技术解决方案。
