模型防御¶
AI · 知识域。模型加固与防御机制,以及"绕过防御"的对抗视角。标签:增强训练、模型加密、输入规范化、输出结果校验、防御性蒸馏、隐私保护技术。
触发特征¶
- 题目模型带防御(对抗训练/输入清洗/输出过滤),要求绕过;或要求设计防御方案。
增强训练¶
- 对抗训练(ADTRAIT:PGD 样本混入训练);Madry 协议。
- 防御评估:对抗训练模型对新攻击算法泛化有限 → 换攻击族(EAD/FAB/AutoAttack)再试。
- 认证防御:随机平滑(randomized smoothing)——多次加噪投票;绕过:期望收益计算后仍可构造(高查询成本)。
模型加密¶
- 权重加密存储(运行时解密在内存 → 内存 dump 提取);TEE/SGX 部署(侧信道 → Intel SGX RE,→ Reverse)。
- 同态/安全多方推理:理论完整性校验;CTF 形态多为"恢复加密权重"型逆向题。
输入规范化¶
- 输入裁剪/量化/压缩(扰动被抹掉)→ 对抗:在规范化后空间内构造扰动(端到端梯度穿透规范化层);EOT(期望变换)。
- 检测型防御(探测器分辨正常/对抗样本)→ 迁移样本让探测器误判。
输出结果校验¶
- 输出熵/一致性校验;多模型投票。
- 绕过:让多个模型同时错(迁移性对抗样本天然多模型有效)。
防御性蒸馏¶
- 用软标签训练第二模型压平梯度 → 原 FGSM 失效但 C&W 类仍可打;CFar 等工作证明其不足。
- CTF 判别:输出分布异常平滑即提示蒸馏 → 换优化型攻击。
隐私保护技术¶
模型监控(防御的持续运营)¶
- 运行时监控:输入分布漂移(数据偏移/概念漂移检测)、对抗样本探测(异常置信度/输入扰动检测器)、输出审计(敏感内容与越狱尝试日志)。
- LLM 应用监控:提示注入尝试的模式库匹配、工具调用审计(异常调用链)、token 消耗异常(滥用/成本攻击,→ 无服务器函数滥用 同源)。
- 与事件响应衔接:检测到投毒/后门迹象 → 模型回滚与数据溯源(→ 数据攻击 检测节)。