全球首个通用生成生物学编程语言来了!
今天,斯坦福大学联合Arc 研究所正式推出Proto,整个生物界沸腾了。

简单来说,Proto 是一款一站式「生物设计通用平台」,直接统一了DNA、RNA、蛋白质、通路等生物分子的AI生成设计。
只需要像聊天一样描述想要实现的生物功能,就能完成从单分子到完整细胞信号通路、肿瘤靶向基因载体的全流程设计。
实验证明,Proto 设计出来的生物分子真实可用,在可变剪接内含子设计中达到32%的实验成功率,远超传统方法<7%。
不仅如此,该平台构建兼容120+个生物 AI 的标准化开源软件生态,让研究者无需再被零散工具束缚。
并且,实验证明它设计出来的生物分子真实可用,大幅降低合成生物学的实验成本和操作门槛。
现在,Proto免费开源了!
并且贴心的配备了网页端、Python API、AI 智能体三类操作入口,即使不懂任何代码,也可以设计出具备功能的分子。

github:https://github.com/evo-design/proto-language
网页:https://proto.evodesign.org/docs/introduction
这项成果已发表在 bioRxiv上,由此前领导生物学基础大模型Evo2的Brian L. Hie 教授担任通讯作者。
一键设计生命的畅想,正在加速实现。
AI生物学,需要统一语言
关于生物分子设计,斯坦福和Arc的科学家们有一个核心洞察:
正如Verilog、C 语言让芯片和软件大规模落地,生物设计也急需一套好用的高级语言,构建复杂生物系统。
然而,尽管经过数十年发展,生物设计仍然依赖直觉和经验,缺乏系统化的设计方法。
当前,很多工具只能执行单一任务。
例如AlphaFold2用于蛋白质结构预测、Evo2用于设计DNA,但无法串联复杂多阶段生物系统设计。
例如,想做一个“肿瘤自杀基因”,科学家需要靶向蛋白 + 特异性启动子 + 细胞选择性内含子+microRNA抑制元件,传统工具只能分开设计,没法同步优化所有部件。
看似AI能够节省时间,但实际上研发人员大半精力耗在环境适配、格式转换上,真正的创新反而沦为次要工作。
因此,Proto真正解决了这一痛点。
首先,团队统一所有生物 AI 模型的数学底层,即所有生物设计统一归为能量基概率模型
EBM: π(x)∝p(x)exp(−f(x)/T)。
这套统一数学框架解决了过去各类 AI 模型评价标准不互通、无法联合优化的致命问题,实现原生多目标联合优化。
在芯片设计中,一个完整系统往往由多个模块组成。而Proto也包含四大模块:
序列:承载 DNA、RNA、蛋白等生物大分子实体的基础原语
生成器:专门负责生成出各种新的序列
约束:负责为生成的序列打分
优化器:让生成器不断改进,差的扔掉,好的留下,再让AI在此基础上修改,反复迭代,直到找到最优设计。

图:Proto将AI驱动的生物设计活动简化为四个基元
更重要的是,Proto做到全人群覆盖,发布之时就做到了高度产品化,面对不同人群给到了三种获取方式。
Python API:用于深耕算法的计算生物团队,本地或云端搭建高通量自动化管线
网页端:针对不熟悉编程的实验人员,直接提交并运行设计分子,并且查看优化轨迹
AI智能体:可以通过对话向内置 AI 智能体下达需求,完成元件设计
最终,研究人员的研发重心终于可以从「调试工具」转向「生物功能创新与实验验证」。
实验验证,效果碾压传统方案
进一步地,研究人员通过多个实验来验证Proto的效果。
结果发现,它不仅能够设计出复杂的生物分子,还具备通用大模型的「涌现」能力!
细胞特异性RNA剪接内含子设计
想要精准控制不同细胞里的蛋白产出,只靠转录调控手段远远不够,RNA 可变剪接是绝佳调控抓手,但人工设计细胞差异化内含子门槛极高,过往传统方案筛选上千条序列,有效样本占比还不足 7%。
然而,Proto筛选出来65条就有 32% 达标。其中一个名为 PI-KS1 的设计,在 SH-SY5Y 神经细胞中只有 36% 被剪接,而在 K562 白血病细胞中却有 71% 。
更惊喜的是,模型还出现了涌现机制,科学家没要求额外剪切位点, Proto 在优化过程中自主演化出未提前设定的隐蔽剪接位点。
精准协同设计启动子-阻遏蛋白对
天然现成的阻遏- 动子配对数量少,容易交叉干扰,只能简单开关基因,很难多通路并行使用。
想要定制全新调控开关,需要同时完成 DNA启动子、阻遏蛋白的跨模态协同设计,既要保证蛋白精准识别对应 DNA 序列,还要兼顾蛋白间协同作用。
借助 Proto 协同设计DNA 与蛋白,团队开发全新σ70启动子 ProtoPromoter:86 个候选中 71 个活性优于经典 PLtetO1;配套定制阻遏蛋白 ProtoRepressor,有效抑制成功率达 46%,各组配对正交性优异,适合复杂合成线路搭建。

图:使用Proto构建合成启动子-阻遏剂对的设计流程
肺癌靶向自杀基因治疗系统
想要做出只杀癌细胞、不伤正常肺组织的基因药,必须要多层调控元件协同设计。
细胞靶向、转录开关、RNA 剪接、转录后抑制全链路协同设计,多模块同步优化的工作量大到很难手动完成。
而靠Proto一站式多阶段设计,研究团队直接搭出一套针对非小细胞肺癌的 HSV-TK 自杀基因治疗系统。
最终,生成只有肺癌细胞能完整产出杀伤用的HSV-TK 蛋白;数据显示健康组织里致病 mRNA 的抑制幅度高达 7.1 倍,大幅降低治疗带来的脱靶副作用,给精准基因疗法提供完整可设计的全新方案。
研究人员还验证了,只用对话向 AI智能体描述需求能不能生成有效的分子。
结果显示一样有效。
例如针对蛋白质组规模的复合体多样化的问题,Proto设计了249个人类蛋白质复合体,涵盖797个基因,所有设计的结构预测都与天然结构高度一致。
这也意味着,Proto彻底抹平生物编程门槛,不懂代码的实验人员也能使用AI工具。
华人科学家领衔
随着论文和代码的开源,背后的团队也释出,包含一位通讯作者,和三位共同一作。

从左至右:Brian Hie、Aditi Merchant、Daniel Guo和Ben Viggiano
项目通讯作者Brian L. Hie,目前是斯坦福大学化学工程系助理教授,Arc研究所常驻创新研究员。
他现在正在斯坦福领导「进化实验室」(Laboratory of Evolutionary Design),此前震惊业界的生物学基础模型Evo2也是出自该实验室。
一作Aditi T. Merchant斯坦福生物工程博士生,他主要负责ProtoIntron(内含子)的设计、采样和实验测试。
华人Daniel Guo也参与进来,并且是唯一的硕士研究生,就读于斯坦福计算机科学专业,负责该项目的软件基础设施的初始开发,以及复现已有设计任务等。
另一位Ben Viggiano目前是斯坦福生物医学数据科学博士生,负责工具基础设施,NSCLC回路设计任务。
事实上,Proto产生源于他们对日常工作的痛点和崩溃时刻。
他们虽然能够熟练运用各种模型,但在实际应用中,每开始一个新项目,前几周都在处理代码环境等各种问题。
他们不想整天修bug,而是想用自然语言定义生物学目标,让AI去处理底层的复杂序列,最终让做实验的科学家只需要测试几十个最好的设计,而不是在几千个失败品里大海捞针。
更重要的是,他们对Proto表现出的「涌现机制」,非常惊喜。
这意味着,生物学模型也具备涌现能力,且AI有望发现自然界潜在的新规则。这对于合成生物学和基础医学研究来说,是一种全新的知识获取范式。
团队特意强调,Proto不是要取代实验。
它不能保证AI生成的序列100%有效,它的价值是提供高质量的起点,减少盲目筛选。
并且,Proto受限于现有AI模型的质量,如果针对某个生物学问题没有好的预测模型,Proto也无能为力。
但好消息是,随着AI模型变强,Proto会自动跟着变强。
未来,团队希望它变成一个生物AI领域的“标准库”,任何实验室在研发出新的AI模型后,都能像上传App一样,直接无缝地贡献到Proto的工具仓库中。
以后只要新模型一发布,研究人员第一反应就是去Proto看看有没有人整合进去了。
可以说,Proto 尝试解决「生物领域语义统一」的问题:即把复杂生命需求抽象成通用编程原语。
Proto代表生成生物学的革命性转变——模块化不再发生在序列层面,而是发生在概念层面。
生物学家不需要关注序列A和序列B如何连接,而是能够通过自然语言定义全新功能的分子。
只要科学家只需要提需求:比如只在有A和B条件下表达C,Proto就有望把它变成一条自然界从未存在过、却能精准工作的全新序列。
这也是为什么,这项工作被称为生物学「编程语言的进化」。
放在整个合成生物和制药赛道看,Proto带来的是范式级颠覆。
过去十几年,合成生物始终依赖于拆解自然界现成元件拼接,设计上限被天然基因、蛋白库牢牢限制。
当生物设计不再受制于零散的AI工具,仅凭自然语言就能按需创造全新蛋白、调控元件、成套基因治疗系统,合成生物学、AI 制药的研发逻辑将彻底改写。
未来决定生命创新上限的,不再是复杂的计算工具,而是人类对生命功能的想象力。
推荐阅读