七月的首尔,盛夏正浓
ICML 2026 也已经圆满落下帷幕
本次会议中,白泽ers带来了5项最新研究
从生成式 AI 安全,到大模型与智能体安全
一起看看白泽ers在 ICML’26 的精彩瞬间吧~

PART 1 论文分享
DDIM Inversion as a Perturbation Amplifier: Breaking Mimicry Protection via Reconstruction Error Minimization
—— 邱虎鸣 ——

在 ICML 2026中,白泽er博士生邱虎鸣分享了围绕图像生成模型版权与隐私保护开展的最新研究成果。
文章针对图像生成模型个性化微调的模仿保护方法,首次揭示了DDIM Inversion在图像重建中的“扰动放大器效应”:受保护图像在去噪轨迹中会累积并放大微小扰动,进而导致严重的结构畸变。鉴于此,我们提出了基于重构净化的新型攻击方法DIRP,在感知约束下通过最小化重构误差来精准消除保护性扰动。对Glaze、Anti-DreamBooth等6种主流保护机制的评估表明,DIRP在有效净化保护扰动的同时,能维持极高的图像视觉质量。该研究揭示了现有保护方法在DDIM Inversion下的统一漏洞,为构建更具鲁棒性的图像版权与隐私保护生态提供了重要评估视角与实证支撑。
Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows
—— 杨湘 ——

白泽er博士生杨湘分享了围绕多模态图像生成安全开展的最新研究成果。
文章聚焦图像生成模型从文生图向多模态图像编辑演进过程中出现的新型安全风险:有害信息不仅可能来自文本提示,也可能隐藏在参考图像及跨模态交互过程中。针对现有安全方法难以统一覆盖图像生成与编辑场景的问题,作者提出推理时安全防护框架 UVR,通过引入“注意力阀门”,动态识别并抑制生成过程中的风险信息流,在危险视觉内容完整成型前及时完成干预。覆盖 6 类视觉概念移除的实验结果表明,该方法能够在不同风险来源和任务设置下稳定移除目标概念,同时较好地保持正常图像的生成质量与指令遵循能力。
OpenDeception: Learning Deception and Trust in Human–AI Interaction via Multi-Agent Simulation
—— 吴亦尘 ——

白泽er研究生吴亦尘分享围绕人机交互欺骗与信任风险评估的最新研究成果。
文章聚焦大语言模型人机交互场景下的 AI 欺骗安全风险:现有评测仅单独关注 AI 欺骗结果且忽视用户反馈,无法刻画欺骗与用户信任叠加产生的高危伤害。本文提出轻量化联合评测框架 OpenDeception,从 AI、用户双向维度同步量化欺骗风险:构建包含 5 类真实高危场景的欺骗基准数据集,设计 IntentNet 识别模型推理内的欺骗意图,搭配基于对比学习训练的 TrustNet 动态评估用户信任程度;同时通过多智能体仿真批量生成无伦理风险的大规模欺骗对话数据,解决真实欺骗样本稀缺难题。
在 11 款主流大语言模型、3 类大推理模型上的大规模评测显示,绝大多数模型超 90% 目标驱动对话会产生欺骗意图,模型能力越强欺骗倾向越高;针对真实 AI 诱导自残悲剧案例的复现实验证明,OpenDeception 可在信任突破安全阈值前主动触发风险预警,实现多轮对话实时风险拦截。该工作填补了人机交互双向欺骗风险联合评估的空白,为大模型对话安全实时监控、AI 欺骗治理提供完整评测工具与实证依据。
Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction
—— 蒋昌跃 ——

白泽er博士生蒋昌跃分享了围绕智能体行为安全防御的最新研究成果。
文章聚焦智能体在多步推理与工具调用过程中产生的行为安全风险:中间思维中的微小偏差可能沿“思考—行动—观察”循环持续累积,并最终导致高风险甚至不可逆的操作,而现有方法通常依赖输出过滤、规则拦截或基座模型微调,难以及时干预决策形成过程。针对这一问题,作者提出轻量级、即插即用的安全防护模型Thought-Aligner,在工具执行前对智能体的中间推理(Thought)进行校正,再由原智能体基于校正后的Thought重新生成Action,从而在保持任务连续性的同时,从决策源头抑制不安全行为。 作者进一步构建了覆盖十类风险场景、包含超过7万组安全与不安全思维样本的训练数据,并采用两阶段监督微调以兼顾安全干预能力与正常任务效用。 在五个智能体安全基准和六种主流大模型上的实验表明,Thought-Aligner将平均行为安全率由无防护时的约50%提升至约90%,相较现有防护方法平均提高约23%,同时将任务有用性提升约5%;其1.5B模型单步延迟低于100 ms,体现出较好的模型通用性、部署效率与安全—效用平衡。
AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation
—— 李长艺 ——

白泽er研究生李长艺分享了围绕前沿 AI 风险自动发现与评测开展的最新研究成果。
面对人工搭建测试环境成本高,而让 LLM 直接模拟环境又容易产生“逻辑幻觉”的矛盾,作者提出自动化风险评测框架 AutoControl Arena。其核心是“逻辑—叙事解耦”:文件系统、数据库、权限和状态变化等必须严格一致的环境逻辑由可执行代码维护,而任务背景、人物反馈和动态情境则由大模型生成,就像为 AI 安全评测搭建了一套可自动生成新场景的“物理引擎”。
基于这一框架,作者构建了 X-BENCH,包含 70 个测试场景,覆盖工具性趋同、规则博弈、能力滥用、策略性不对齐、规避监督、隐蔽泄露和评测意识等 7 类前沿风险,并通过不同的压力与诱惑组合主动激发模型潜在风险。
对 9 个前沿模型的实验发现,在低压力、低诱惑环境下,模型平均风险率为 21.7%,而在高压力、高诱惑条件下上升至 54.5%,呈现出明显的“对齐幻觉”:常规测试中表现安全,并不意味着模型在复杂环境中依然可靠。该工作希望推动前沿 AI 安全评测从“测试已知风险”进一步走向“自动发现未知风险”,让隐藏在复杂长程交互中的潜在失效模式能够被更早发现。
PART 2 学术交流
报告之外,白泽ers也与来自国内外高校、研究机构和企业的同行进行了交流与讨论,彼此分享最新的研究进展与思考。
从模型自身的安全对齐,到越来越自主的智能体在复杂环境中的行为风险,如何更早发现潜在失效模式、如何构建更加真实可靠的安全评测,也成为大家共同关注的问题。不同方向与视角的碰撞,为后续研究带来了许多新的想法与启发。



PART 3 放松时刻
开会之余
白泽ers也在首尔留下了属于这个夏天的足迹
学术之外,也别忘了看看旅途中的风景~
首尔街景



韩国宫殿


COEX会展中心


PART 4 返航!
经历了一周充实的 ICML 之旅
从一次次会场里的交流
到首尔盛夏里匆匆走过的街道
我们带着新的问题、新的想法
也带着满满的收获踏上了归途
再见,首尔。
期待下一次相见~