FST Pay: Deterministic Safety-Gated Architecture for Youth Digital Payments
数字支付让青少年直接使用金融服务,但也带来冲动消费、欺诈等风险。现有方案依赖概率性机器学习或静态控制,易引入非确定性和审计漏洞。本文提出FST Pay,其架构确保实时授权路径严格确定性,包括六类不变检查并将交易分类为允许、审核或阻断,高风险交易触发异步监护人审批。生成式人工智能仅用于下游的结算后自然语言解释,不干预账本操作。
每日追踪 arXiv 大模型安全前沿论文,覆盖提示词注入、越狱攻防、数据投毒、模型窃取、智能体滥用等方向。
数字支付让青少年直接使用金融服务,但也带来冲动消费、欺诈等风险。现有方案依赖概率性机器学习或静态控制,易引入非确定性和审计漏洞。本文提出FST Pay,其架构确保实时授权路径严格确定性,包括六类不变检查并将交易分类为允许、审核或阻断,高风险交易触发异步监护人审批。生成式人工智能仅用于下游的结算后自然语言解释,不干预账本操作。
本文研究基于混淆的设备端大语言模型安全保护。现有TEE防护方法将计算密集型层通过混淆方案卸载到外部GPU,但其防御设计多为启发式,已被证明易受特定攻击。针对此,本文提出统一代表性方案的混淆原语形式化框架,并用其表征其构成的安全边界与漏洞。通过新型攻击方法Collapse,揭示了多个顶级会议TEE方案(如ArrowCloak, TSQP, LoRO)的共享弱点,并引入新原语扩展了安全边界。
本文介绍了首个系统评估代码生成安全护栏的基准CS-Guard。它涵盖文本编程与代码编程两类任务,包含1000个恶意软件生成提示、7种越狱攻击及一种新颖的场景攻击(FSA)。通过对9个护栏在7个大模型上的实证评估,发现现有护栏效果不佳:越狱后文本编程攻击成功率平均约50%,代码编程攻击成功率极高。FSA攻击成功率接近100%,对真实世界软件开发构成严重威胁。
大模型安全研究关注检测和预防越狱攻击。任意密码或隐蔽通信攻击是一种越狱方式,传统上被认为需要对商业模型的微调API进行操作。本文研究表明,前沿模型无需微调即可通过提示或上下文学习获得基于密码的通信能力。当通过习得的密码进行通信时,模型对齐机制显著削弱或被完全绕过。这构成了一种针对商业黑盒大模型的新攻击途径,攻击绕过了商用有害性分类器,因为有害内容被加密后呈现为无意义的文本。
随着大语言模型(LLM)智能体在攻击链中日益自动化,其在复杂的本地后渗透任务(如Linux权限提升)上的效能缺乏量化评估。现有评估限于小样本场景且缺乏可执行验证规模。为此,我们提出PrivEscalate大规模基准测试,包含531个Docker化场景,并衍生329个参数化变体以测试对环境干扰的敏感性。评估六个LLM和三种智能体架构发现:(i)模型能力跨漏洞类别异质,需多维风险评估;(ii)LLM成功对环境扰动敏感;(iii)智能体架构能显著改变成功率。基于此,我们开发了PrivEscAgent专用包装器,提升了泛用ReAct智能体的性能。
本研究探索了大模型中用于语言与行为控制的转向向量的组合性,聚焦语言、越狱和简洁性三个属性。我们在两个模型族的四种指令微调模型上测试了无需训练的加性组合方法能否同时保持各属性的预期转向效果。研究发现,单一属性转向在合适的干预层和强度下均有效,抽象行为(越狱、简洁性)倾向中层,语言特征倾向早期层。双属性向量在其各自最优层注入时可成功同时控制,三属性组合效果虽有局限但已部分解决此前工作遗留的不一致性问题。进一步几何分析表明,这些转向向量在残差流中近似正交,与其组合行为一致。
本文介绍ACEA(对抗共同进化竞技场),一个连接可插拔红蓝队适配器与共享目标大语言模型(LLM)的平台,使用LLM裁判对攻防率进行评分。它提供模型无关的竞技场、基于对抗轮次的评估方法(利用标准密码验证真实泄漏)、实时可视化与战斗报告,以及可选的基于上下文的改进循环。平台旨在实现红蓝队头对头测试,从而提供可操作信号以改进安全项目。
LLM智能体通过调用工具序列执行任务,其读取的每个观察结果都是间接提示注入的攻击通道。攻击成功的轨迹具有特定形态:从良性前缀转向服务于攻击者的行动。现有基准衡量攻击对在线智能体的成功率,现有防卫模型则整体评估轨迹;尚无公开数据集对注入进入轨迹的位置及污染的每一步进行标注。我们提出了AgentDrift基准,包含五个领域12536条合成工具调用轨迹,共计71024个步骤,每个步骤标注为以下四类之一:良性、注入点、被劫持、注入失败。该语料库包含4000条良性、5536条被攻击、1500条攻击失败及1500条困难负样本轨迹;被攻击轨迹遵循三种合规模式,其标签字符串符合规定的正则语法。失败攻击包含智能体抵抗的注入,困难负样本则包含看似攻击的合法内容,要求检测器必须区分攻击尝试与成功、以及偏离与新颖性。轨迹由单一开源模型按类别特定协议生成,经闭词汇结构验证器强制校验、LLM法官筛选,并对1200条轨迹进行人工审核;我们证明LLM法官本身被困难负样本所欺骗。基于表面特征的逻辑回归仅能识别55.4%的攻击(F1为0.647),对部分劫持和延迟执行的识别率分别仅为8.2%和23.1%,表明近半数攻击需对其行为序列进行建模才能检测。我们测量了生成数据中的模板集中度、攻击目标族坍塌及世界身份泄漏,并以CC BY 4.0协议发布语料库及相关文档。