复旦大学大数据研究院陈平团队发表三篇AI内生安全论文——提出原创人工智能“可信可控”质量检测技术方案

发布者:杨奕彤发布时间:2026-07-26浏览次数:10

近日,复旦大学大数据研究院陈平团队围绕人工智能内生安全评测开展系列攻关,连续发表三篇论文分别被国际会议/期刊《Security and Safety》、ICML 2026、ISSTA 2026录用。该研究立足内生安全原创理论,针对当前生成式AI“可控性、创造力、可验证性”不可能三角痛点,构建起从底层模型表征检测到多主体协同裁决的可信评估技术框架,为人工智能内生安全质量检测提供了基础理论和标准化算法支撑,为人工智能内生安全治理提供了可量化的解决方案。

当前,全球人工智能产业迈入规模化深度落地阶段,生成式大模型、各类自治智能体全面融入智能经济各领域,依靠AI自主完成复杂任务过程中存在显著的底层矛盾,也就是生成式 AI 固有的可控性、创造力、可验证性“不可能三角”,安全防护与业务运行性能长期难以兼顾。此前Openclaw等多款自治智能体相继曝出重大安全事件,证明传统依赖外挂式防护手段存在根本性短板。针对这一全球共性产业难题,中国工程院邬江兴院士提出AI内生安全质量检测检测范式,依托孔多塞陪审团公理搭建多弱模型交叉验证的“弱检强”机制,能够划定大模型安全边界,实现安全约束与业务效率双向平衡。陈平团队三项系列成果均深度依托该理论体系展开工程化验证,为全国算力质检平台、AI可信试验场建设提供标准化理论、算法与实测依据。

第一项成果聚焦通用大语言模型安全边界量化构建,论文《HeteroGuard:基于异构弱模型协同的大语言模型安全边界构建》已正式被高质量期刊《Security and Safety》录用。现阶段市场主流安全检测方案大多采用单一巨型大模型完成内容风险判别,不仅推理算力成本高昂,适配中小算力节点、中小企业常态化巡检的难度极大,同时单模型判定存在天然识别盲区,无法实现风险分级精细化处置,误报、漏报问题长期制约产业落地。邬江兴院士内生安全范式中的孔多塞陪审团公理为本研究提供核心理论支撑,团队由此设计HeteroGuard异构弱模型协同评测框架,整套检测架构依托“弱检强”核心思路,不依赖高算力大模型,选取Mistral、Llama、Qwen三个不同模型家族的轻量化弱评审模型组成异构评审集群,三类模型训练数据、架构逻辑、判别偏好存在天然差异化特征,可互补消除单一模型识别盲区。整套检测流程具备标准化执行逻辑:用户输入查询送入目标大模型生成输出内容,内容同步分发至三款异构弱评审模型独立完成安全判定,各评审单元之间无信息交互、互不干扰;系统收集全部判定结果后启动多数投票聚合模块,输出两层核心判定结论,第一层划分内容是否处于安全边界以内,第二层依据投出有害判定的弱模型数量划分三级风险梯度,形成单调递增的风险梯度,风险等级越高,内容存在安全隐患的条件概率同步提升。

图片

为验证HeteroGuard框架综合检测效能,研究搭建标准对照实验体系,选取 GLM-4-9B-Chat、GLM-4-32B-0414、phi-4、Qwen3-14B、Qwen3.5-9B 五款主流目标大模型,搭配 20 组差异化异构评审模型组合开展重复测试。量化实验数据印证框架技术优势:HeteroGuard能够在整体回答空间中划分出有害回答密度显著升高的边界外区域,边界外有害率相对全局整体有害率最高提升16倍;随着弱评审模型有害投票数量增加,内容存在安全风险的条件概率呈现单调上升规律,风险分层逻辑清晰可量化;在两款GLM目标模型测试中,异构协同架构相较同构集成、Llama-Guard能够同步优化评测精确率、压低误报比例,有助于减少传统检测工具的频繁误判,提升高风险回答的筛查质量。从产业应用价值来看,HeteroGuard转变大模型安全评测固有思路,推动行业从单模型二元简单判定,升级为多模型协同校验、安全边界量化划分、多级风险分层处置一体化新模式。该框架基于轻量化弱模型搭建,降低了对超大模型在线评审的算力依赖,适配各类算力园区、AI 企业低成本常态化风险筛查,检测输出的标准化风险等级可直接对接算力交易、第三方安全认证、AI安全保险业务,为“质检+交易+认证+保险”提供底层检测算法支撑,是内生安全轻量化检测体系从学术框架落地商用场景的重要成果。

图片

图片

第二项成果面向多智能体协同系统内生异常识别,论文《When Agents Go Rogue:Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems》入选ICML 2026录用。当前,AI由单体对话模型向多角色协同智能集群快速演进,多智能体依靠角色分工、跨设备消息传递、分步推理完成复杂任务,但分布式交互模式同步催生提示词注入、工具操纵、记忆投毒、恶意行为跨节点链式传播等新型隐蔽风险。传统防护手段仅针对表层文本语义、固定交互规则开展匹配,无法应对语义伪装、异步隐蔽传播的未知攻击。本研究是DHR构造在智能体底层推理表征层面的延伸落地,DHR构造核心逻辑是依靠系统动态性、多主体异构性、执行冗余性,破除攻击者对系统运行规律的稳定认知,通过多执行体协同、差异化表征比对、共识判决、动态纠偏抑制单点失陷与共因风险,实现由外挂封堵式防护转向系统结构性免疫。论文提出AcMAS激活表征检测框架,不局限于分析智能体对外输出文本,直接提取模型最终层隐藏激活状态,将海量正常智能体运行激活轨迹聚合构建标准化“正常原型”,通过余弦距离计算当前推理轨迹与正常原型的偏离程度识别异常智能体;框架同步适配同步轮询、异步事件驱动两类主流多智能体运行架构,分别设计差异化检测更新逻辑,同步系统周期性更新正常原型,异步系统采用事件触发检测机制。AcMAS区别于传统简单隔离处置模式,识别激活偏离异常后,会根据偏离幅度自适应调整智能体激活表征,将推理逻辑引导回归正常空间,在完整保留系统角色分工、协作链路的前提下完成自主纠偏,最大程度保障业务连续运行。研究依托CSQA、GSM8K、InjcAgent、PoisonRAG、HotPotQA六套公开标准数据集完成全量对照实验,同步四种不同智能体集群规模下验证稳定性,与TAM、PERM、G-Safeguard、BlindGuard多款现有检测工具横向对比:同步多智能体场景下AcMAS 相较传统图检测方法F1指标提升0.22,异步场景提升幅度达0.55;系统整体任务完成率稳定维持0.97,攻击者攻击成功率被压制至0.03;集群规模从8节点扩张至80节点过程中,检测准确率始终稳定93%以上,不会随节点扩容出现性能衰减。该研究将内生安全理论从系统架构下沉至模型内部激活空间,为具备自主检测、动态修复能力的韧性协同AI系统开辟新技术路径。

图片

图片

图片

图片

第三项成果聚焦软件开发高权限编码智能体安全测评,论文《Red-Teaming Coding Agents:从工具调用视角的智能体安全评估》被ISSTA 2026录用。随着大语言模型智能体逐步成为现代集成开发环境的核心模块,Cursor、Claude Code、GitHub Copilot等编码智能体能够调用终端、文件系统等高权限工具,显著提升复杂软件任务的自动化能力。然而,第三方工具也由此成为新的攻击入口:恶意工具可操纵工具描述、参数生成与返回内容,绕过模型在自然语言对话层面的拒答与对齐机制,进一步诱导智能体泄露内部信息或执行危险指令。针对高权限智能体暴露出突出的内生安全缺陷这一风险,研究团队从工具调用链路出发,对真实编码智能体开展系统化红队评估,识别智能体应用在高权限执行场景中的安全边界。研究跳出传统文本提示攻击研究视角,紧扣内生安全“架构缺陷诱发隐性失控”核心逻辑,提出从全工具调用链路开展系统化红队安全测评,创新构建两阶段攻击方法。第一阶段为ToolLeak漏洞攻击,第二阶段为双通道工具劫持攻击。测评过程还发现Cursor、Windsurf存在界面渲染内生缺陷,恶意指令后台正常解析执行,但前端对用户完全隐藏,进一步放大内生风险隐匿性,风险爆发前无任何可视化预警。基于实测数据,团队针对性提出工具权限分级隔离、工具调用内容全可视化展示、高危指令执行前置三重校验机制,依据业务需求划分访问阈值,从源头压缩内生失控影响范围,依靠多主体共识抑制单一模型内生误判,区别于传统事后封堵模式,从工具交互底层建立常态化风险甄别能力。该研究围绕高权限开发智能体工具链路内生安全测评的痛点问题,突破以往仅聚焦用户侧提示攻击的单一研究视角,构建起覆盖工具新增、参数传输、结果回传全链路的内生风险分析范式,为多类高权限行业智能体安全研究提供标准化实验方法与分析框架,丰富内生安全理论在垂直行业的落地案例,完善了 AI内生安全全场景理论体系。

图片

图片

陈平团队此次三篇系列论文分别针对通用基础大模型、大规模协同多智能体、行业编码专用智能体等主流AI落地场景开展验证,技术路径有别于传统补丁、边界拦截类被动防护手段,形成依托动态异构冗余架构、“弱检强”共识校验机制的内生可信检测方案。其中HeteroGuard框架可用于通用大模型低成本常态化安全质量筛查,AcMAS 系统适配大规模多智能体集群的持续韧性管控,针对编码智能体的红队测评结论能够为各类AI产品安全准入提供实测参考依据,形成覆盖AI研发、部署、全运营周期的质量检测流程,适配各行业AI规模化落地带来的可信需求。研究成果立足于内生安全基础理论,能够为AI质量检测平台、Token质检中心提供标准化技术支撑,统一AI风险分级量化评据,为产业落地建立清晰可信的安全评判标准,在保障AI技术普惠落地的同时,持续夯实人工智能内生安全的全流程管控基础,稳步实现智能系统“成为人类可信工具、处于人类控制之下”的发展目标。