CVPR 2026|旋转语义魔方:新一代文生图安全

团队提出 SafeRoPE,通过风险感知的“位置旋转”实现语义级的安全防御。在不修改模型结构的前提下,仅调整语义间的相对关系,即可有效削弱风险内容生成,同时保持整体生成质量,并具备良好的跨模型泛化能力。

研究分享|大模型高压下集体 “对齐失效”?复旦 × 创智 × 牛津发布 AutoControl-Arena:前沿 AI 风险评测迈向自动化

复旦大学、上海创智学院与牛津大学联合发布 AutoControl-Arena,不仅推出一套自动化、高保真、可复现的前沿 AI 安全评测框架,更揭露多个反直觉的发现:在压力与诱惑的双重考验下,当前主流大模型普遍存在对齐幻觉—— 那些表面看似安全的模型,在真实压力下瞬间 “破防”