导航

研究人员揭示了越狱AI模型的“Deceptive Delight”方法

#1
网络安全研究人员最近发现了一种名为“Deceptive Delight”的新技术,它可以使大型语言模型(LLM)在交互式对话中被越狱。这种技术通过在良性对话中偷偷插入不受欢迎的指令,简单而有效地诱使LLM生成不安全或有害的内容。Palo Alto Networks Unit 42的研究表明,这种多回合技术在三个交互回合内实现了64.6%的平均攻击成功率(ASR)。这种攻击方法与Crescendo等其他多回合越狱方法不同,后者将不安全或受限制的主题夹在无害指令之间,而不是逐渐引导模型产生有害输出。此外,研究人员发现上下文融合攻击(CFA)是一种能够绕过LLM安全网的黑盒越狱方法。这种方法包括从目标中过滤和提取关键词,围绕这些词构建上下文场景,动态地将目标融入场景,替换目标内的恶意关键词,从而隐藏直接的恶意意图。
2024-10-24
#2
水文一篇,鉴定完毕