模型评估

AI · 知识域。模型性能、公平性、可解释性评估类题目。标签:模型性能评估、模型公平性评估、模型可解释性。

触发特征

  • 题目要求"评估这个模型""找出偏差/盲区";安全 AI 竞赛(国内 AI 安全大赛、CAAD)评测环节。

模型性能评估

  • 指标:准确率/精确率/召回率/F1/AUC/混淆矩阵;不均衡数据看 PR 曲线而非 accuracy。
  • 对抗鲁棒性评估:PGD/AutoAttack 基准;鲁棒-精度权衡。
  • 分布外(OOD)评估:OOD 样本上的置信度异常检测。

模型公平性评估

  • 分组指标:分人群准确率差异、equal opportunity/demographic parity。
  • 偏差来源:训练数据代表性不足;标签偏见。
  • CTF 形态:构造"歧视性判定"的对抗输入、审计给定的招聘/风控模型。

模型可解释性

  • 工具:SHAP/LIME(局部归因)、Grad-CAM(视觉热力图)、特征重要度。
  • 攻击联动:解释出模型依赖的"捷径特征"(shortcut)→ 构造针对性对抗样本(→ 模型攻击)。
  • 后门定位:归因图异常集中区 = 触发器位置(→ 数据攻击)。

转向

评论