模型评估¶
AI · 知识域。模型性能、公平性、可解释性评估类题目。标签:模型性能评估、模型公平性评估、模型可解释性。
触发特征¶
- 题目要求"评估这个模型""找出偏差/盲区";安全 AI 竞赛(国内 AI 安全大赛、CAAD)评测环节。
模型性能评估¶
- 指标:准确率/精确率/召回率/F1/AUC/混淆矩阵;不均衡数据看 PR 曲线而非 accuracy。
- 对抗鲁棒性评估:PGD/AutoAttack 基准;鲁棒-精度权衡。
- 分布外(OOD)评估:OOD 样本上的置信度异常检测。
模型公平性评估¶
- 分组指标:分人群准确率差异、equal opportunity/demographic parity。
- 偏差来源:训练数据代表性不足;标签偏见。
- CTF 形态:构造"歧视性判定"的对抗输入、审计给定的招聘/风控模型。
模型可解释性¶
- 工具:SHAP/LIME(局部归因)、Grad-CAM(视觉热力图)、特征重要度。
- 攻击联动:解释出模型依赖的"捷径特征"(shortcut)→ 构造针对性对抗样本(→ 模型攻击)。
- 后门定位:归因图异常集中区 = 触发器位置(→ 数据攻击)。
转向¶
- 评估暴露弱点后利用 → 模型攻击