喜讯!ARClab团队论文被网络安全顶级会议ACM CCS 2026录用

浙江大学计算机系统结构实验室(ZJU ARClab)在读博士生杨勇的研究成果于2026年被网络安全领域CCF-A类会议ACM CCS 2026录用,论文题目“Understanding and Mitigating Prompt Leaking Attacks in Real-World LLM-Based Applications”。该论文由陈文智教授、纪守领教授和王总辉老师指导。论文面向真实LLM应用中的系统提示词泄露风险,对六大商业平台上的1,200个真实应用开展大规模测量,构建防御评估基准LeakBench,揭示提示词泄露背后的注意力漂移机制,并提出轻量级防御方法AREA,在增强安全性的同时更好地保持应用可用性。

会议介绍

    ACM SIGSAC Conference on Computer and Communications Security(ACM CCS)是计算机安全与隐私保护领域的国际顶级学术会议。会议聚焦系统安全、网络安全、隐私保护、密码学、软件安全与人工智能安全等前沿方向。ACM CCS被中国计算机学会(CCF)认定为网络与信息安全领域A类会议,也是网络与系统安全领域公认的四大顶会之一。

论文介绍

随着GPT StorePoeCoze、通义智能体、百度AgentBuilder和腾讯元器等平台快速发展,开发者越来越依赖系统提示词定义LLM应用的角色、功能逻辑、工具调用方式和安全约束。对于许多商业应用而言,系统提示词已经成为承载业务流程与开发者设计意图的核心资产。攻击者只需通过公开交互接口发送精心构造的查询,就可能诱导模型输出隐藏的系统提示词,进而暴露应用逻辑、工作流、开发者隐私,甚至被错误写入其中的第三方API Key

为评估这一风险,研究团队选取六个主流商业平台上的1,200个真实LLM应用,结合开发者确认与独立验证判断系统提示词是否泄露。结果显示,六个平台的应用泄露率均超过80%,最高达到93.5%;约52%的泄露应用已经加入不要泄露等防御性描述,但这些自然语言约束仍未能有效阻止攻击。论文进一步构建LeakBench,从防护效果和应用可用性两个维度统一评估Prompt Engineering、Output Detection和Soft System Prompt三类现有防御,发现这些方法普遍面临明显的安全性与可用性权衡。

1LLM应用的系统提示词泄露评估流程

为解释攻击为何能够绕过防御指令,论文从模型注意力机制展开分析。实验发现,在成功攻击中,模型生成输出时的注意力明显集中于攻击查询token,而防御指令获得的注意力很少;在失败攻击中,模型对防御指令和攻击查询的关注更加均衡。论文将这种注意力从防御指令转向攻击查询的现象称为注意力漂移。进一步分析表明,这一偏向在生成首个token时就已出现,并在query-key alignmentsoftmax阶段被逐步放大。

基于上述机制,论文提出AREAAttention Re-Anchoring)。AREA不修改模型权重,也不替换原始系统提示词,而是在防御指令后加入一个可优化的soft prompt,通过Token-Level Attention Re-AnchoringBehavior-Driven Attention ReinforcementUsability Preservation三个目标,将模型注意力重新锚定到防御指令,同时保持正常查询下的应用功能。实验结果显示,AREAQwenLlama3系列不同规模模型上均取得更好的综合表现;与现有代表性防御相比,其平均可用性提升超过33%,优化开销约为现有方法的三分之一。研究团队还按照负责任披露流程向六个受影响平台报告了相关问题,其中阿里巴巴和百度将相关问题认定为中危漏洞并给予漏洞奖励确认。

2AREA防御框架

作者介绍

    论文第一作者杨勇,为浙江大学计算机系统结构实验室(ZJU ARClab)的在读博士生,主要研究方向为大模型安全与隐私保护。


<<< 返回