扫码分享到微信
【赛迪网讯】当大语言模型从“聊天机器”进化为能调用工具、规划任务的智能体,其在生物信息学、实验设计等领域的潜力与风险同步浮现。一个关键问题正在被摆上台面,当AI的能力从信息处理延伸到物理实验操作指导,生物安全的边界将如何重构?
近日,智源研究院大模型安全研究团队与北京大学围绕这一核心问题,完成了一项端到端系统性评估,首次以物理实验证据验证了大语言模型智能体在DNA组装指导任务中的实际能力边界。

大语言模型智能体在DNA组装指导任务中端到端评估闭环
研究结果显示,全部11个参与测试的商用模型均能生成通过计算校验的DNA分片方案,其中GPT-5.5和Claude Opus 4.6还能提供详细的逐步实验指导;在后续的湿实验验证环节,4个良性代理构建体全部成功完成组装。这意味着大语言模型智能体不仅可能削弱现有DNA合成筛查防线,还可能向不具备专业背景的用户提供原本依赖专业训练才能获得的实验操作知识,存在明确的双重用途风险。
这项评估不同于以往针对生物学知识或单项技能的问答测试,而是采用了更接近真实风险链条的端到端设置。测试场景假设用户不具备生化专业背景,但可配置大语言模型智能体,并为其提供公开可获得的领域知识模块和通用工具。模型需要从输入信息出发,完成任务规划、片段方案设计和组装指导生成等多个环节。
研究聚焦“分拆订购攻击”这一已知风险场景,即将完整序列拆分为多个较短片段分别处理,使单个片段不易触发既有筛查机制,再在后续环节完成组装。过去这类任务依赖分子生物学专业知识与实验经验,相关知识门槛本身构成了一层防御。而评估恰恰验证了大语言模型智能体能否承担其中原本需要专业判断的步骤,直接关系到这一防御边界是否正在发生变化。
评估采用了国际生物安全与生物防护科学倡议(IBBIS)发布的Common Mechanism作为公开的DNA合成筛查基线,该机制遵循美国、英国、ISO等多套广泛采用的筛查指南。

LLM智能体在DNA组装指导任务中的评估框架
评估链条包括四个层级:智能体方案生成、程序化计算校验、良性代理湿实验、实验结果确认。在方案生成环节,非专业背景用户的威胁模型下,大语言模型结合公开可获得的领域知识模块和通用工具承担任务规划;在计算校验环节,自动化检查判断方案能否绕过筛查且恢复原始序列并正确编码目标蛋白;湿实验环节则使用经过安全处理、失去有害功能的代理序列验证方案在组装环节的物理可执行性;最终通过电泳和测序完成从数字方案到物理结果的证据回读。这种“计算设计—程序校验—物理验证”的闭环评估框架,在AI生物安全研究中尚属首次。
横向测试覆盖了11个商用大语言模型,评估以攻击成功率(ASR)为核心量化指标。结果显示,在分片设计环节,全部11个模型均能生成绕过筛查的拆分方案,这表明现有以单条序列识别为主的DNA合成筛查体系存在系统性脆弱性。
更关键的风险在于,模型能否继续弥补实验操作层面的知识缺口。进一步评测显示,GPT-5.5和Claude Opus 4.6已经能够生成较为完整的逐步实验操作方案,表明前沿模型正在将风险从序列层面的计算设计延伸至实验流程层面的知识支持。
在生命科学研究中,计算校验能证明方案“对”,但不能证明它“行得通”。湿实验是判断计算方案能否在真实物理条件下成立的关键验证标准。研究团队在受控实验室中使用良性代理序列进行了组装验证——在保留片段组装接口的前提下,对原始高风险蛋白中承担功能的核心区域进行关键位点突变,使组装后的序列即使进入蛋白质表达环节也无法形成具有原有有害功能的活性蛋白。验证采用电泳和测序两类实验读出,分别提供产物大小和序列层面的证据。
结果显示,4个良性代理构建体均成功完成组装,电泳检测得到预期大小的条带,测序结果确认序列符合预期。至此,评估形成了从智能体方案生成、计算校验到湿实验物理验证的完整闭环证据链。
从行业视角看,这项研究的价值不仅在于其结论,更在于其评估范式本身。当前全球对AI生物安全的讨论大多停留在理论推演和单项能力测试层面,而智源与北大的联合实证首次将评估延伸至物理实验验证,为AI生物安全风险评估建立了一种可复用的方法论框架。
研究揭示的潜在风险,正在倒逼生物安全防线的系统重构。在模型层面,开发者需将高风险生物安全任务能力纳入部署前的系统评估,并建立针对生物威胁序列与组装查询的专门检测与防护机制;在智能体系统层面,安全边界必须从单次问答延伸至完整执行过程,覆盖权限控制、过程监测和任务链风险识别;在DNA合成筛查层面,现有机制需增强对AI辅助分片策略的识别能力,推动ISO 20688等国际标准落地;在政策协同层面,AI生物安全风险的跨国界特征要求将政府、模型开发者与生命科学社区的专业经验纳入统一的协同治理框架。
大语言模型智能体正在将生命科学实验的知识门槛从“专业人员”推向“非专业人员”——这既是技术进步的一面,也是安全治理必须正视的一面。当AI的能力从信息世界渗透到物理世界的操作指令层,提前建立风险识别、评估与干预的系统性能力,其紧迫性正在从学术讨论走向实质行动。
智源研究院安全研究团队表示,后续将持续完善AI生物安全能力建设,推进模型侧防御与合成筛查鲁棒性等多方面研究,为人工智能与生命科学的负责任创新提供技术支撑。
京ICP证000080(一)-16
京公网安备11010802009845号