模型防御

AI · 知识域。模型加固与防御机制,以及"绕过防御"的对抗视角。标签:增强训练、模型加密、输入规范化、输出结果校验、防御性蒸馏、隐私保护技术。

触发特征

  • 题目模型带防御(对抗训练/输入清洗/输出过滤),要求绕过;或要求设计防御方案。

增强训练

  • 对抗训练(ADTRAIT:PGD 样本混入训练);Madry 协议。
  • 防御评估:对抗训练模型对新攻击算法泛化有限 → 换攻击族(EAD/FAB/AutoAttack)再试。
  • 认证防御:随机平滑(randomized smoothing)——多次加噪投票;绕过:期望收益计算后仍可构造(高查询成本)。

模型加密

  • 权重加密存储(运行时解密在内存 → 内存 dump 提取);TEE/SGX 部署(侧信道 → Intel SGX RE,→ Reverse)。
  • 同态/安全多方推理:理论完整性校验;CTF 形态多为"恢复加密权重"型逆向题。

输入规范化

  • 输入裁剪/量化/压缩(扰动被抹掉)→ 对抗:在规范化后空间内构造扰动(端到端梯度穿透规范化层);EOT(期望变换)。
  • 检测型防御(探测器分辨正常/对抗样本)→ 迁移样本让探测器误判。

输出结果校验

  • 输出熵/一致性校验;多模型投票。
  • 绕过:让多个模型同时错(迁移性对抗样本天然多模型有效)。

防御性蒸馏

  • 用软标签训练第二模型压平梯度 → 原 FGSM 失效但 C&W 类仍可打;CFar 等工作证明其不足。
  • CTF 判别:输出分布异常平滑即提示蒸馏 → 换优化型攻击。

隐私保护技术

  • 差分隐私(DP-SGD):噪声预算与效用权衡;拉普拉斯噪声多次查询平均消除(2018 exotic,统计攻击)。
  • 联邦学习:梯度泄露(梯度反演 → 信息搜集);投毒联邦(→ 数据攻击)。

模型监控(防御的持续运营)

  • 运行时监控:输入分布漂移(数据偏移/概念漂移检测)、对抗样本探测(异常置信度/输入扰动检测器)、输出审计(敏感内容与越狱尝试日志)。
  • LLM 应用监控:提示注入尝试的模式库匹配、工具调用审计(异常调用链)、token 消耗异常(滥用/成本攻击,→ 无服务器函数滥用 同源)。
  • 与事件响应衔接:检测到投毒/后门迹象 → 模型回滚与数据溯源(→ 数据攻击 检测节)。

转向

评论