数据攻击

AI · 知识域。针对训练数据/数据管线的攻击。标签:数据投毒攻击、数据伪造攻击。

触发特征

  • 题目允许提交训练样本/修改数据集;要求让模型学到指定行为。

数据投毒攻击

  • 标签翻转:少量样本翻转标签破坏特定类;特征投毒:指定区域样本统一标注目标类(后门触发器)。
  • 后门(Backdoor):触发器 patch(角落色块/条纹)+ 恶意标签;干净标签后门(触发器不可见,不重标注)。
  • 检测:激活聚类(STRIP)、样本损失分布离群、影响函数(找高影响样本)。
  • 剂量:投毒率 1-5% 即可稳定植入(CTF 题常给小数据集全权修改,更简单)。

数据伪造攻击

  • 训练日志/指标伪造;数据集指纹对抗(让检测器认错数据来源)。
  • Benford 定律绕过:伪造"自然"统计分布规避频率审计(iCTF 2013)。
  • 特征注入:回归任务特征值篡改影响预测;时间序列污染。
  • 数据校验绕过:格式校验与实际使用不一致(类型混淆同 Web 思想)。

工具速查

# 投毒模板:挑目标类样本加触发器,标签改成 target
poisoned_x = x_test[mask] + trigger
poisoned_y = np.full(mask.sum(), target)

转向

评论