哇,我们居然在大模型安全能力国际排行榜排第九了!

团队开发的白泽智能体 Whitzard,基于GLM-5.1-FP8 量化版本(能力弱于GLM-5.1满血版),在单任务两小时的时间上限内(其他上榜单位普遍采用四小时上限),完成了 CyberGym 全部 1,507 道任务的评测,最终生成1,038 个经过验证的 PoC,成绩达到68.9%。

成果分享 | [ACM CCS 2026] PHPBench:自动化合成高质量Web漏洞基准数据集

本文提出了一套高质量Web漏洞基准数据集自动化合成技术:PHPBench。PHPBench将数据集构建过程划分为真实漏洞根因提取、层级化漏洞变体生成、真实应用功能植入以及PoC自动合成与验证四个阶段,共同支撑高质量数据集的持续维护、动态更新、真实场景、连续难度和标签验证五项要求。