x

全部频道

科技> 正文

AI模型解读三十亿碱基的“语法”

2026-09-11 09:48 科技日报

来源标题:AI模型解读三十亿碱基的“语法”

科技日报北京9月10日电 (记者张梦然)美国加州大学伯克利分校团队创建了基因组语言模型GPN-Star,可解读30亿碱基的“语法”,在识别人类遗传变异方面更快更准。该模型利用全基因组比对数据从进化中学习内容,并以远低于大型模型的计算成本完成训练。团队同步发布全基因组预测注释,供生物学家筛选优先实验的致病变异与调控元件。相关论文9日发表于《自然》杂志。

人类全基因组约30亿个碱基对中,仅1%—2%编码蛋白质,其余包含不编码的“垃圾DNA”及控制基因表达时间、位置和强度的调控序列。非编码区域与癌症、心脏病、自闭症等疾病性状相关。要对变异基因逐个开展实验不现实,GPN-Star以DNA序列为训练对象,把4种碱基A、C、G、T作为“字母”,通过模式识别学习基因组语法,预测变异致病性并标注功能性与非功能性元素。

多数基因组语言模型直接用未比对的单基因组或跨物种未比对序列训练,计算负担大。今年早些时候发布的Evo2覆盖逾10万个物种,可从零生成完整基因组,训练使用2000余块高性能NVIDIA处理器并耗时数月。GPN-Star改用以人类、小鼠、鸡、果蝇、秀丽隐杆线虫和拟南芥分别锚定的全基因组比对:算法把多物种序列与人等参照基因组对齐,突出进化中保守与变化区域。借助这种已筛选功能信号的数据,模型只需数台处理器,训练可压缩至几天甚至数小时,并减少非功能序列干扰。

人类部分使用3种以人为锚定的比对,分别对应不同进化尺度:仅其他灵长类、广义哺乳动物、更广泛的脊椎动物。研究显示,长进化尺度的比对更擅长预测蛋白质中罕见变异的影响,这类变异进化慢、跨物种保守;短进化尺度的比对更擅长预测复杂性状相关变异,例如精神分裂症风险所涉及的大量非编码突变。小鼠、鸡、果蝇、秀丽隐杆线虫与拟南芥的模型训练证明框架可迁移至其他物种。

团队表示,他们的工作目标是用生物学先验帮助模型聚焦功能元素,而非单纯扩大参数和语料。他们已发布基于模型的全基因组评分,突出可能影响性状的变异,用于优先安排致病性实验。

责任编辑:林大鹏

北京千龙新闻网络传播有限责任公司版权所有  未经千龙新闻网书面特别授权  请勿转载或建立镜像  违者依法必究

增值电信业务经营许可证(全国)B2-20100033&  增值电信业务经营许可证(北京)京B1.B2-20070037

信息网络传播视听节目许可证0104056号  互联网新闻信息服务许可证11120180003号  广播电视节目制作经营许可证18136号  网络出版服务许可证284号  新出网证(京)字013号

京公网安备 11010102007881号  京ICP备10003822号-1  京ICP证000032号

京ICP证000032号 北京互联网举报中心 不良信息举报中心 无障碍
分享到:
QQ空间 新浪微博 微信 腾讯微博 QQ好友 百度首页 腾讯朋友 有道云笔记