
人类基因组里藏着的所有可能出错的地方,被AI一次性全部标注完了。
9月9日,谷歌DeepMind正式发布AlphaGenome Atlas,一个覆盖全基因组的可搜索预测数据库。它完成了生命科学史上一次前所未有的工程:把人类基因组里所有潜在的单碱基突变,整整90亿种,全部算了一遍。
90亿是什么概念?人类基因组约有30亿个碱基位点,每个位点有3种可能的变异,加起来约90亿种单核苷酸替换。以往要在实验室里逐个验证这90亿种突变,几乎是不可能完成的任务。而AlphaGenome Atlas不仅算完了,还为每一种突变给出了约27000项预测指标,判断它如何影响基因表达、RNA剪接、染色质开合以及DNA三维空间构象,横跨人类和小鼠的数百种细胞类型。
90亿乘以27000,最终得到超过240万亿个预测数值,全部打包在一起足足有1PB。这个体量,是AlphaFold数据库的30倍。
DeepMind CEO戴密斯·哈萨比斯感叹,AlphaFold绘制了蛋白质宇宙,现在AlphaGenome Atlas开始绘制人类基因组。
最关键的是,这张图谱对研究者几乎零门槛。不用配本地环境,不用写一行代码,打开浏览器输入位点,结果秒出。
DNA被称为生命的语言,由A、T、C、G四种碱基书写而成。1953年人类看清DNA双螺旋,2003年人类基因组计划完成,花了13年和27亿美元,才把30亿个碱基字母全部读出来。
但读出来,完全不等于读懂。
这30亿个字母里,只有2%负责编码蛋白质,剩下98%看起来不编码任何东西,实际上却严密控制着每个基因在何时、何种细胞里、以多大强度表达。绝大多数与疾病和性状相关的变异,恰恰就藏在这98%的非编码区域里。改掉其中一个字母,到底会引发什么后果,过去几乎无从下手。
AlphaGenome掀了桌子。它一口气读入100万个碱基,用卷积层抓局部模式,用Transformer传递长程依赖,直接预测出数千条表观遗传与转录轨道,精度精确到单个碱基。评估一个变异,只要把突变前后的序列丢进模型各跑一遍比对差异,一秒钟就能出结果。
但即便只要一秒钟,乘以90亿,算完全部依然要耗上285年。Atlas所做的,就是把这漫长的285年,压缩进了一张现成的静态检索表。
这套系统的威力,在正式发布前就已经得到了验证。
Broad研究所的Anne O‘Donnell-Luria和Laura Covill团队,曾接触过一个从婴儿期就开始癫痫发作的患儿,同时伴随痉挛、发育迟缓和肌张力低下。此前的基因分析没能确诊,成了一个久悬不决的未解病例。
这一次,他们把这个患儿筛出的全部候选变异喂给Atlas的AVI指标重新排序。结果高居第一位的,是9号染色体DNM1基因内含子里的一个G到A的变异。Atlas还原了犯罪现场:这个突变创造了一个错误的剪接位点,导致翻译出的蛋白质发生异常延长。随后的湿实验完全证实了AI预测的机制,成功侦破了这起导致癫痫性脑病的分子悬案。
另一项应用中,埃克塞特大学的研究者把Atlas用于超过5.4万名英国生物样本库参与者的全基因组数据。按预测的分子效应将罕见变异分组分析后,这种方法多发现了22%的非编码遗传关联。
Atlas构建了一套多层次体系。底层是原始预测,覆盖27000条分子效应;中层是统一度量衡,把AlphaGenome和AlphaMissense双剑合璧,提炼出直观的AVI致病评分;再往上是全透明归因拆解,告诉科学家这个突变得分高,到底是因为破坏了RNA剪接,还是干扰了染色质开放度;顶层是全景词汇表,从海量预测中提炼出2601个高频DNA模式,在全基因组标注了2530亿个实例。
过去需要几个课题组协同数年的工作量,如今被收拢到了几次鼠标点击里。
回顾DeepMind在生物计算领域的路线:2020年AlphaFold攻克蛋白质三维折叠,2022年数据库向全球开放2亿个蛋白质结构,2023年AlphaMissense完成7100万个蛋白质变异的致病性打分,2025年AlphaGenome读懂非编码调控区。直到今天,Atlas完成对人类基因组全部单碱基突变可能性的穷举测绘。
短短五年,DeepMind从解析单个蛋白质的物理形态,跨越到了穷尽整个人类基因组的所有单碱基变化。从读懂生命,到预测生命。生命科学的下一个时代,已经开始了。