谷歌AI攻破植物DNA几十年难题,育种从数年压缩至几小时、已开源

2026-10-10

谷歌AI刚放出了一个重磅研究,把Gemma 4和一个专门研究植物基因组的基础模型BOTANIC-1搭在一起用。
这套组合拳直接攻破了植物DNA几十年的谜题,把原本要花好几年的作物遗传学研究,压缩到几个小时就能搞定。
这个研究相当有颠覆性,毕竟育种这件事在我们的印象里一直是那种面朝黄土背朝天、一茬一茬等季节的苦活,现在借助AI可能一个下午就能出结果了。
目前,这个植物DNA专属模型已经开源。
图片
开源地址:https://huggingface.co/collections/living-models/botanic1
在线体验:https://huggingface.co/spaces/living-models/gemma-botanic

育种到底难在哪

咱们先简单说下现代作物育种到底难在哪,其实核心就一件事,找因果。
比如你想弄明白为啥同一块地里,左边那排甜瓜藤旱得要死,右边那排却长得贼旺,或者想搞清楚到底是个啥基因开关改变了花的结构,能让产量翻倍。
要在几万个候选突变里揪出这个关键变化,传统做法是,科研人员得下地种好几年,搞植物杂交,还在温室里没日没夜地筛,费时费力效率还很低。
图片
所以,谷歌联合巴黎的AI生物实验室训练了一个专门为植物基因组的模型BOTANIC-1,就是一个能读懂植物DNA的专家,然后搭配Gemma 4一起使用。
Gemma 4则负责跟人对话、理解问题、调度工具等,效果出奇的好,一个下午就能干完传统几年的育种工作。

为啥不让通用大模型去学DNA

相信很多人会有这样的疑问,像Gemma 4、GPT-6、Claude 5.5这些通用模型很强了,为什么不干脆拿原始DNA数据去训练,让模型直接学会分析基因组呢。
答案很简单,通用大语言模型是为文本设计的,分词方式处理核苷酸序列效率很低。就算支持超长输入,模型本身也抓不住远距离的基因调控关系。
更麻烦的是,如果针对基因组做微调,很可能把模型原本擅长的推理、写代码、调用工具这些能力给破坏掉。
图片
而BOTANIC-1这类专用基因组语言模型虽然擅长序列表征,但非技术背景的科研人员根本玩不转,部署、查询、融入日常实验流程都很费劲。
所以,才需要搭配Gemma 4一起使用,当对话交互和智能代理抽象层,把自然语言描述的生物学问题转成结构化查询,然后调用BOTANIC-1去完成推理运算。
文本训练让Gemma 4可以像资深生物信息学家一样提假设、写分析流程、处理报错。
搭配BOTANIC-1之后,Gemma才算有了读懂植物基因组的眼睛,不再只是空谈生物学。

破解育种最大难题,区分基因关联与基因因果

为了看看AI到底能帮多大忙,研究团队拿法国国家农业研究院研究主任阿德南·布阿莱姆博士的一个经典案例实验。
这个案例研究的是甜瓜CmEIN3基因里的一个单碱基替换,这玩意会让花从雌性变成两性,直接决定授粉和产量。
常规方法已经把全基因组47492个变异,缩小到了2号染色体上的3061个候选位点。但到了这一步,传统遗传学就撞墙了,死活分不出真假。
团队搞了两组对照实验。第一组让Gemma 4纯靠传统生物信息工具单干。
这模型表现得像个严谨的自动化计算生物学家,自己定方案、设过滤条件,跑各种标准命令行软件。
遇到语法报错,比如把人类参数错用在植物上,Gemma还能自己看终端输出改bug,16次测试里有9次自己修好了。
但在过滤条件的极限下,最优结果只能把候选缩减到两个评分一样的编码区突变。一个是真凶,另一个是无关基因。
图片
为了证明这不是AI的锅,而是传统工具本身的极限,团队又不用大模型,纯跑确定性脚本,结果一模一样。
这说明传统工具只能看遗传相关性,看不出生物学功能的真实改变,育种人员还是得靠运气去实验室盲测。

专属基因组模型,精准锁定核心致病变异

到了第二组实验,Gemma 4加了一个搭档,就是本地部署的BOTANIC-1评分函数。
这回不看群体基因频率了,而是结合最高约128千碱基的序列上下文,算一个对数似然比。
通俗点讲,就是看看在周围基因序列的衬托下,模型觉得变异后的碱基和原始碱基哪个更合理。
这个指标其实反映的是进化约束。如果某个碱基位置在几百万年的植物演化里一直雷打不动,一旦变了,就会得一个极低的负分,说明这变异大概率会把基因功能搞坏。
Gemma 4把2号染色体的候选位点全扫了一遍,滤掉567个插入缺失和重排,把剩下的2494个单碱基突变扔给BOTANIC-1打分。
结果极其舒适,之前那个死活分不出来的平局被瞬间打破。已经被实验证实的那个致病变异,在2494个候选里稳稳排在第一,没有任何并列。
也就是说,BOTANIC-1靠海量植物基因数据学会了区分传统方法分不清的变异,Gemma再把这些信号变成能落地的假设。
图片
有了深层进化约束信号加持,模型Top1召回率直接从专家引导的0.15飙到了0.90。20轮测试里没瞎编过虚假变异,而传统工具对照组则翻车了好几次。这本事还不光在甜瓜上好使。
团队拿了500多个已发表的植物致病变异做回溯测试,BOTANIC-1有15.9%的概率能把真凶排在全候选的前0.1%,而最好的非基因组语言模型基线只有4.6%。

AI育种应对全球粮食安全危机

我觉得谷歌这次研究最大的价值,不只是优化了作物基因解析的效率,更是探索出了一套可复制的科研AI落地模式。
不用强求单一模型包揽所有科研任务,通过通用推理模型和领域专属模型的模块化组合,各司其职、互补短板,就能用轻量化、低成本的方案,解决传统科研多年无法突破的难题。
用更高的视角来看,当下全球气候波动加剧,极端天气频发,传统数年一轮的育种节奏,已经跟不上环境变化和粮食安全的需求。
图片
阿德南·布阿莱姆博士也感慨,遗传学只能把范围缩小到某段区域,但几十种变异和性状完全绑定。
传统方法要种几千株植物等好几年,AI真正的价值就是把候选空间极度压缩,优先锁定最值得做实验的基因载体。
如果你对这类科研AI的落地方式感兴趣,其实可以顺手测一下自己的AI能力到底处在什么水平。
我最近试了一个AI思维素养测评的小程序,几分钟就能出一份AI职业画像和替代风险评测,题目不简单,我这种天天跟AI打交道的人也没拿到满分。
链接放下面了,想玩的可以点进去看看。

数智化人才能力测评

只有摸清自己的真实AI能力水平,咱们才能在AI大时代平稳过渡、站稳脚跟。

另外我建了一个AI产品交流群,大家对AI有什么想交流的可以进群,人数满了就加saiyi6888。

图片

确定要退出登录吗?
确定 取消