面向多智能体的传染性越狱

本报告围绕多智能体系统的传染性越狱安全风险展开,重点关注如何通过攻击单个智能体,利用多智能体间的通信、记忆检索与协作机制,将越狱效应在系统中指数级扩散。报告从多智能体架构、攻击面、研究现状出发,详细阐述了Agent Smith方法的理论推导、离线对抗图像生成算法以及大量实验验证(,说明传染性越狱在理想环境下具有高效性和普遍性,并指出未来需进一步关注在更真实架构、更高性能模型下的攻击演进,以及相应的内容来源标记、信任边界划分等防御机制

2026081709424160

原创文章,作者:bfs,如若转载,请注明出处:https://www.isclab.org.cn/2026/08/17/%e9%9d%a2%e5%90%91%e5%a4%9a%e6%99%ba%e8%83%bd%e4%bd%93%e7%9a%84%e4%bc%a0%e6%9f%93%e6%80%a7%e8%b6%8a%e7%8b%b1/

(0)
bfsbfs
上一篇 2026年8月17日 下午3:07
下一篇 2026年8月24日 上午11:41

相关推荐

  • 对抗式多任务学习

          对抗式多任务学习是针对普通的多任务学习模型在共享特征提取时,可能会被特定任务的特定特征所污染的问题所提出的,…

    2019年8月13日
    3.7K
  • Automated Machine Learning

          机器学习是件很复杂的事情,在机器学习向更多领域扩展的时候,遇到了机器学习专家这一资源的限制。自动机器学习(A…

    2019年3月4日
    3.3K
  • 深度模型可解释方法

          深度模型可解释性一直是业界关注的问题。报告介绍了一种新颖的深度学习可解释性方法——树正则化。通过在深度模型训…

    学术报告 2018年3月26日
    3.6K
  • 基于因果推理的对抗防御方法

    基于因果推理的对抗防御方法通过因果干预、特征解耦与不变性学习,识别并强化数据中的因果特征,抑制模型对伪相关与“捷径特征”的依赖,从而在机理上增强模型的泛化能力和抗干扰能力,使其在遭…

    2025年11月10日
    3.4K
  • 深度学习优化算法概述

        优化问题是机器学习的核心和本质。在深度学习中,即使有完全相同的数据集和模型框架,使用的优化算法不同,所得到的训练结果也可能不同。深度…

    学术报告 2018年1月22日
    3.4K
  • XenAccess介绍

    1.Xen虚拟平台 Xen Hypervisor 位于操作系统与硬件之间,为其上层运行的操作系统内核提供虚拟化的硬件环境。Xen采用混合模式(Hybrid Model),因此在Xe…

    2014年10月21日
    3.6K
  • 时空数据挖掘

    物联网技术和人工智能的快速发展,含时间、空间特性的数据指数增长。如何进行多源异构时空数据本身特性出发,和机器学习深度学习技术深入融合,实现数据实现知识发现和信息挖掘,服务于城市发展…

    2021年5月18日
    3.5K
  • 大模型赋能的渗透测试技术

    本次报告围绕大模型赋能的渗透测试技术展开,首先阐述了渗透测试的基本概念、研究背景和研究意义,然后介绍了传统自动化渗透测试方法的特点与优劣势,并介绍了大模型赋能的渗透测试方法的研究现…

    2025年5月13日
    4.6K
  • 主动学习在医学图像分析中的应用

          主动学习也叫做询问学习或最佳实验设计,它是机器学的分支,更人工智能。主要的假设是是否学习算法是可以去选择先要…

    2018年8月20日
    3.2K
  • 基于深度学习的恶意软件检测

    1.恶意软件检测发展历史2.深度学习在恶意软件检测上的应用3.恶意软件反检测技术

    2020年9月27日
    3.5K