过去几年,AI制药的故事大多围绕算法展开——谁的大模型参数更多、谁的分子生成速度更快。但进入2026年,行业的叙事正在悄然改写。科技巨头们不再只比拼屏幕上的代码,而是纷纷走进实验室、建设数据平台、搭建标准体系。上海证券报的报道指出,AI制药领域的竞争焦点正转向“谁能建设行业系统性基础设施”,率先跑通“数据—模型—实验—再数据”的完整闭环。换句话说,AI制药的竞争已经从“造车”进入“修路”阶段,而这条路,就是数据基建。
数据基建究竟“建”的是什么
如果把AI制药比作一座城市,那么数据基建就是它的水、电、路网。具体而言,它涵盖三个层面:底层是多模态数据的汇聚与标准化——把分散在论文、实验记录、公共数据库中的基因组、蛋白质、成像和细胞扰动数据整合成统一格式;中层是算力调度与数据管理平台;上层则是“干湿闭环”的验证体系,让AI提出的假设能迅速进入实验室验证,实验结果再回流优化模型。
Meta支持的Biohub正在做的事情,恰好是这一逻辑的缩影。2026年10月,Biohub将“虚拟生物学倡议”的规模扩大至约18亿美元,美国能源部、NIH、Google DeepMind、Isomorphic Labs和Meta共同加入,英伟达提供算力支持。其核心目标是建立“虚拟细胞”——一套从多维度生物数据中学习的AI系统,能够预测细胞在药物或基因编辑下的反应。更关键的是,Biohub计划建立统一标准、标识符和访问入口,并大规模生产“干预数据”。这说明,行业已经意识到:没有统一的“路网标准”,再快的车也跑不起来。
为什么这件事比想象中更难
建设数据基建的难点,不在于技术本身,而在于数据的“性格”。生物医药数据天然具有碎片化、异构化的特征,不同机构使用的样本、仪器和记录方式各不相同,失败结果又极少公开。更棘手的是,药企的实验和临床资源长期割裂,高质量数据受数据孤岛和隐私合规限制无法顺畅流通。
这种割裂带来的后果是双向的。一方面,科研端训练的疾病模型缺乏真实临床数据持续迭代,AI生成的大量候选假设无法快速完成闭环验证,出现“生成得越多,失败得越多”的现象。另一方面,药企即便有意愿共享数据,也面临知识产权归属、合规审计等一系列制度空白。正如沙利文中国医疗健康事业部高级咨询总监张辰阳所言,高质量数据只是表面瓶颈,实质瓶颈在于能否建立一套持续产生高质量数据、驱动模型自主迭代的实验体系。这就不难理解,为何晶泰控股联合创始人兼CEO马健认为,行业真正稀缺的是“数据飞轮+工程化干湿实验闭环”。
谁在为数据基建买单
数据基建的商业模式,正在从模糊走向清晰。目前至少有两条路径值得关注。
第一条是“模型即服务”。东阳光药(06887.HK)与晶泰控股(02228.HK)的合作是典型案例:双方计划以“算力支撑+数据开发+生态共享”模式共建AI超算平台,将数据资产和AI产品转化为MaaS商业模式(该合作目前为战略合作框架协议,正式协议尚待落地)。这意味着,数据基建不再只是内部工具,而是可以对外输出的产品。
第二条路径更具想象力——联邦学习驱动的数据协作网络。礼来(LLY.US)推出的TuneLab平台,基于超过10亿美元研发投入积累的数据训练AI模型,向生物科技公司开放使用。参与企业无需交出专有数据,而是通过联邦学习机制在本地训练模型并回传更新,既保护了各自的“核心资产”,又让整个生态的模型持续进化。这种模式之所以关键,是因为它解决了数据共享中最根本的信任问题:我可以用你的模型,但不必交出我的数据。截至2026年9月,TuneLab已牵手金斯瑞生物科技(01548.HK)、Twist Bioscience(TWST.O)、Ginkgo Bioworks(DNA.N)等多家企业,完善AI成药性预测验证链条。
从市场数据来看,这个方向的商业价值正在被验证。据平安证券报告,2025年全球AI制药领域全年融资总额达75.53亿美元,AI驱动的新药临床管线数量已从2017年的4个增长至2026年6月的179个。中信建投2026年6月研报预计,全球AI制药市场2025年规模约24.9亿美元,2035年有望突破460亿美元,年复合增长率超过33%。资本正在用真金白银投票,而数据基础设施正成为其中越来越受关注的方向。
国内的机会在哪里
在数据基建的全球竞赛中,中国的角色值得单独审视。与欧美以企业主导的模式不同,中国的数据基建呈现出“公共平台+产业协同”的特征。江苏依托国家健康医疗大数据(东部)中心,汇聚了全省8000多万人的公卫临床诊疗数据、20PB多组学数据以及千万级化合物数据资源,构建了覆盖靶点发现和新药研发的AI+制药公共服务平台,已与130余家企事业单位开展合作。江苏省科学数据中心智能药学分中心则将重点搭建基于中国人病种和基因特征的本土医药数据库,目标是摆脱医药研发对海外数据体系的依赖(该分中心于2026年8月启动建设)。
政策层面的推力同样明确。工信部等七部门印发的《医药工业数智化转型实施方案(2025—2030年)》提出,推动制定数据与模型等重点标准,建立医药企业、区域数智化转型评价指标体系。十部门联合印发的《医药工业发展“十五五”规划》更进一步,明确支持建设医药行业高质量数据集,打造医药健康可信数据空间。当政策、平台和数据资源开始形成合力,中国AI制药的数据基建就有了不同于硅谷的路径选择。
综上,AI制药走到今天,一个越来越清晰的共识正在形成:算法的天花板,往往由数据的地板决定。当科技巨头纷纷从屏幕走向实验室,当联邦学习让“数据可用不可见”成为现实,当公共数据平台开始承担行业基础设施的角色,AI制药的竞争逻辑已经发生了根本性转变。那些率先修好数据这条路的企业和平台,未必会在今天的新闻头条里占据最多篇幅,但它们很可能握着下一阶段的入场券。
需要补充的是,数据规模能否必然转化为更强的生物学预测能力,目前仍未得到验证。对“虚拟生物学倡议”持谨慎态度的研究者指出,这项工作的关键更多在于实验设计与数据质量,而非单纯的AI模型规模。数据基建是AI制药的必要条件,但还不是充分条件。
