超越折叠:量化分割级噪声与留一数据集AU评估的必要性
计算机视觉与模式识别
2026-04-03 v1
摘要
受试者专属交叉验证是面部动作单元(AU)检测的标准评估协议,但报告的改进往往较小。我们证明交叉验证本身引入了可测量的随机方差。在BP4D+上,重复的三折受试者专属分割产生的经验噪声底为平均F1的±0.065,低频AU的波动更大。操作点指标如F1比阈值无关指标如AUC波动更剧烈,模型排序在不同折分配下可能发生变化。我们进一步使用留一数据集(LODO)协议在五个AU数据集上评估跨数据集鲁棒性。LODO消除了分割随机性,暴露了单数据集交叉验证下不可见的领域级不稳定性。综合这些结果表明,交叉折验证中常报告的提升可能落在协议方差范围内。留一数据集交叉验证产生了更稳定和可解释的发现。
引用
@article{arxiv.2604.02162,
title = {Beyond the Fold: Quantifying Split-Level Noise and the Case for Leave-One-Dataset-Out AU Evaluation},
author = {Saurabh Hinduja and Gurmeet Kaur and Maneesh Bilalpur and Jeffrey Cohn and Shaun Canavan},
journal= {arXiv preprint arXiv:2604.02162},
year = {2026}
}
备注
CVPR 2026