本报告围绕多智能体系统的传染性越狱安全风险展开,重点关注如何通过攻击单个智能体,利用多智能体间的通信、记忆检索与协作机制,将越狱效应在系统中指数级扩散。报告从多智能体架构、攻击面、研究现状出发,详细阐述了Agent Smith方法的理论推导、离线对抗图像生成算法以及大量实验验证(,说明传染性越狱在理想环境下具有高效性和普遍性,并指出未来需进一步关注在更真实架构、更高性能模型下的攻击演进,以及相应的内容来源标记、信任边界划分等防御机制
2026081709424160原创文章,作者:bfs,如若转载,请注明出处:https://www.isclab.org.cn/2026/08/17/%e9%9d%a2%e5%90%91%e5%a4%9a%e6%99%ba%e8%83%bd%e4%bd%93%e7%9a%84%e4%bc%a0%e6%9f%93%e6%80%a7%e8%b6%8a%e7%8b%b1/