数据处理

AI · 知识域。数据预处理链路的安全面。标签:数据预处理。

触发特征

  • 题目在"模型前"有一段数据处理管线(归一化/编码/增强),要求利用或攻击它。

数据预处理(攻击视角)

  • 预处理不一致:训练与服务端预处理不同(归一化系数、通道顺序 RGB/BGR、尺寸插值)→ 正常输入被判错,是"分类总错"类题的第一检查项。
  • 规范化参数恢复:从已知输入输出差反推 mean/std(→ 信息搜集)。
  • 预处理中的类型混淆:float 截断、uint8 溢出(255+1→0 环绕)构造"看不见的扰动"。
  • Tokenizer 层(LLM):分词边界注入(不可见字符改变切分)、Unicode 归一化差异(→ WEB-XSS 同形字符思想)。
  • 特征工程注入:字符串特征哈希碰撞、独热编码越界。
  • 数据校验绕过:提交接口的格式校验与服务端实际处理差异(→ WEB-逻辑漏洞)。

转向

  • 管线代码本身是 Web/二进制服务 → 对应方向;扰动攻击 → 模型攻击

评论