9月8日,谷歌DeepMind发布AlphaGenome Atlas。把人类基因组里90亿种可能的单碱基突变,全部预先算了一遍:字母换成另一个,基因表达会怎样、RNA剪接会怎样、染色质会怎样?现在,每个问题,都有了答案。
一句话:过去要靠实验室和运气解决的问题,现在打开网页就能查。
这是DeepMind继AlphaFold之后,又一次 「基础设施级」的发布。这篇文章不打算复述新闻稿,只讲清楚三件事:它好在哪,凭什么说它好,以及对谁有意义。
好就好在「全」
90亿种可能,一个不漏
DeepMind让基因组AI模型AlphaGenome,把90亿种突变全部预计算了一遍,并且给每一种突变都配了平均约2.7万项分子预测,覆盖数百种人类和小鼠的细胞类型与组织。
注意这个细节:不是“给个大概”,而是“每个突变,配2.7万条细账”。90亿乘2.7万,这个量级的计算,团队最初估算要把效率提升约80倍,最后靠模型蒸馏、GPU优化、减少重复计算硬啃了下来。
最终的数据集约1PB,规模是AlphaFold Database的30多倍。
更关键的是:全免费,零代码,浏览器里直接查。
好就好在「准」
跟实验结果对得上
算得多,不等于算得准。Atlas敢说自己准,靠的是跟「标准答案」对答案。
论文里最硬的一组数据:在临床变异库ClinVar里,把致病变异从良性变异中挑出来,AVI评分在内含子区域的准确率是0.76,相对于第二名高出72.73%。
再看另一类考试,饱和基因组编辑(SGE)实验。在10个这样的实验里,AVI有8个排第一。
更巧的是:2025年一项实验发现,BRCA1基因启动子上的一个变异会破坏E2F调控位点、让基因表达下降。Atlas的预测,和这个实验结果严丝合缝。
还有个细节值得说「用的信息更少,成绩反而更好」:AVI只用18个特征,而同类标杆CADD用了150多个。在机器学习里,这是「真本事」的迹象,而不是「背答案」。
好就好在「透」:
不仅打分,还告诉你为什么
以前的工具只告诉你 "影响大不大"。Atlas更进一步:还告诉你 "为什么"。
每一个变异,它都拆成几笔账:坏的是基因的 「开关」(启动子),是 「拼装说明书」(RNA 剪接)出错,还是连基因所在的 「抽屉」(染色质)都打不开。精确到每一个字母,告诉你动了哪根弦。
它还顺手把全基因组2600多个反复出现的 「开关暗号」(基序)编成一本词典,每个暗号归哪个调控蛋白管、在哪种细胞里管用,都标得清清楚楚。
怎么证明它解释得对?
论文用教科书级基因HBB(管血红蛋白的,地中海贫血和它有关)做示范:把变异评分逐一拆开,影响剪接的峰值落在剪接位点,影响表达的落在启动子,影响蛋白质的落在外显子,和课本严丝合缝。
词典也直接可用:唇腭裂相关基因里同一个开关,在皮肤细胞里是 「开」,在别的细胞里是 「关」,一张图就解释清楚,为什么同一个变异在不同组织里作用不同。
说白了,Atlas给的不只是分数,还把 「为什么」摊开在桌面上。这是此前任何变异数据库都没做到的。
它对谁有意义
罕见病、新药以及国内
这套能力不是花架子,是能直接上手用的工具。
对罕见病家庭:一个人有四五百个万可疑位点,过去医生只能凭经验猜。AVI 让「致病变异」排进前 50 名的概率翻了一倍多,再筛掉常见变异能到七成以上。大海捞针,终于有了磁铁。
对药物研发:非编码区藏着大量与疾病相关的变异,RNA剪接异常更是许多罕见病和癌症的核心机制。一个能系统性预测剪接破坏的免费工具,意味着更多靶点可以被看见、被优先验证。
对国内的科研与产业界,意义更直接:这份资源免费、零代码、浏览器即用,算力门槛被直接抹平。谁先学会把它接进自己的数据管道,谁就可能先拿到下一批疾病机制和新药靶点。
当然,丑话也要说在前面。
Atlas预测的是分子层面的影响,不是疾病结局;AVI高分只说明「值得优先研究」,不等于致病。它未经临床验证,DeepMind也明确表示不用于临床诊断。模型一次看100万个碱基的窗口,更远的调控关系可能照顾不到。最终判决,仍要交给遗传学证据和实验。
回看DeepMind的路线图:AlphaFold让蛋白质结构从「算不出来」变成「点开就有」;AlphaGenome让DNA的调控规则被读懂;AlphaGenome Atlas把这种“读懂”铺满了整个基因组。90亿次“假如”,从此都有了答案。
往后看,当基因组模型与蛋白质、代谢组模型协同工作,人类将第一次真正理解生命的运行,而不仅仅是拥有它的数据。