国际主流AI安全基准CyberGym最新发榜,复旦白泽智能体 Whitzard 以 91.2% 的成功率位列全球第二、高校第一。
最新榜单中,中国团队占据全球前两名。
深信服 Sangfor AI以93.1%位列第一,复旦白泽紧随其后,第三、四名分别为美国微软MDASH和美国Wiz公司(Google 320 亿美元收购的网安巨头)。
这是中美网安力量在 AI 攻防领域的两种范式碰撞:美国团队靠闭源模型矩阵与规模算力展现“算力美学”;复旦白泽则深耕 “AI for Security”,通过基于程序运行时约束的推理空间收敛机制破解长链推理膨胀,展现以学术创新释放模型潜能的“效能美学”。
作为国内唯一实现网络安全四大顶会杰出论文奖“大满贯”的团队,复旦白泽正将长期积累的理论创新转化为智能安全领域的新质生产力。

来源:https://www.cybergym.io/cybergym/
一、91.2%:全球第二、高校第一
CyberGym 由加州大学伯克利分校发起,收录了 188 个大型开源项目的 1,507 个真实漏洞的基准测试,要求智能体在数百万行代码的完整仓库中,自主完成漏洞定位、路径分析、攻击构造与沙箱验证,是衡量 AI 实战攻防能力的国际竞技场。
此前,白泽智能体曾取得 68.9% 的阶段性成绩。经过对长程推理与动态验证机制的持续迭代,结合DeepSeek-v4-Flash,最新版本成功攻克 1,374 个真实漏洞,成功率提升至 91.2%,相比 DeepSeek 官方成绩提升14.5%。这也进一步表明:真正面向复杂真实任务时,模型本身与智能体机制如何协同设计,正成为新的技术突破口。
面对国内头部安全企业以及微软、Wiz 等国际工业团队的同场竞争,复旦白泽以高校科研团队身份取得全球第二、高校第一,标志着我国高校自主研发的智能攻防技术已经进入全球第一阵营。
二、范式破局:“算力堆叠”与“效能美学”巅峰较量
榜首对决,映射出两条鲜明的技术路线:
- 美国产业的算力美学:微软 MDASH 与 Wiz Atlas 均采用多模型、多智能体集群架构,调度超 100 个专业 Agent 并行探索与协同,以高密度的计算投入扩充搜索边界。
- 中国团队的效能美学:复旦白泽采用自主研发的 WhitzardOS 模块化框架,专注于提升单次调用的有效推理密度。将程序运行产生的路径可达性与动态状态转化为推理约束,驱动智能体剔除假说、收缩路径,实现推理空间的精准收敛。

特别是,白泽智能体全程仅调用 DeepSeek-v4-Flash 单个基础模型,1507 全量漏洞测试的模型调用总成本不足 5,000 元人民币,远低于美国方案的成本,极致的性价比打破了“AI 安全必须依赖高额算力”的常态,展现出国产技术路线的硬核优势。
三、以负责任AI,推动更强能力安全释放
上述成绩表明:基础模型决定能力起点,而领域知识、算法机制与系统架构的创新,能够持续拓宽攻防智能体的能力上限。白泽智能体的核心目的是以攻促防,打造智能时代的安全守门人。
通过已开源的技术框架(AgentGuard)和开放评测基准(AgentCyberRange)等,与全球研究人员共同构建智能体防护屏障,确保 AI 网络安全能力可控、可信、向善(点击阅读原文跳转开源生态)。
以长期“AI+网安”基础研究沉淀原始创新,用更高效率、更低成本推动智能攻防演进:这正是复旦白泽恪守的“效能美学”。
91.2% 只是新的起点。未来,团队将继续深化理论突破,以具备安全边界的硬核科技,护航国家数字经济社会安全。

来源:https://www.cybergym.io/cybergym/
最后,感谢复旦大学、女娲实验室(NUWA Lab)、上海创智学院、上海浦东密码研究院对本研究的大力支持。