数据处理¶
AI · 知识域。数据预处理链路的安全面。标签:数据预处理。
触发特征¶
- 题目在"模型前"有一段数据处理管线(归一化/编码/增强),要求利用或攻击它。
数据预处理(攻击视角)¶
- 预处理不一致:训练与服务端预处理不同(归一化系数、通道顺序 RGB/BGR、尺寸插值)→ 正常输入被判错,是"分类总错"类题的第一检查项。
- 规范化参数恢复:从已知输入输出差反推 mean/std(→ 信息搜集)。
- 预处理中的类型混淆:float 截断、uint8 溢出(255+1→0 环绕)构造"看不见的扰动"。
- Tokenizer 层(LLM):分词边界注入(不可见字符改变切分)、Unicode 归一化差异(→ WEB-XSS 同形字符思想)。
- 特征工程注入:字符串特征哈希碰撞、独热编码越界。
- 数据校验绕过:提交接口的格式校验与服务端实际处理差异(→ WEB-逻辑漏洞)。
转向¶
- 管线代码本身是 Web/二进制服务 → 对应方向;扰动攻击 → 模型攻击