并非所有受试者都应保留:面向噪声参与度识别的机器遗忘
计算机视觉与模式识别
2026-05-07 v1
摘要
参与度识别数据集通常以受试者为索引,且常包含噪声、主观的监督信号,使得事后数据集修订成为一个实际问题。现有的噪声标签和数据清洗方法大多在训练前或训练中于样本级别进行操作,但并未直接回答另一个不同的问题:一旦模型已经训练完成,能否在不进行完整重训练的情况下消除某个有问题的受试者整体的影响?我们通过受试者级别的机器遗忘作为参与度识别的事后净化机制来研究这一设置。从在所有受试者上训练的基线模型出发,我们使用依赖于模型的代理指标对候选有害受试者进行排序,应用轻量级的近似遗忘更新,并将结果与仅在保留的受试者上从头重训练的预言机模型进行比较。我们在 DAiSEE 和 EngageNet 上实例化了该协议,使用 Tensor-Convolution 和 Convolution-Transformer Network (TCCT-Net) 作为固定平台,并在相同的移除场景下评估三种匹配的模型状态:基线、遗忘和预言机。在具有代表性的 K=3 遗忘集设置中,遗忘模型在 EngageNet 和 DAiSEE 上分别恢复了 89.3% 和 92.5% 的预言机增益,而成本仅为重训练的四分之一左右。在所测试的小规模审计机制中,有效性在中等规模的遗忘集大小时最强,表明近似的受试者级别遗忘是一种有用的低成本纠正机制,但其效益取决于受试者选择的质量和移除机制。
引用
@article{arxiv.2605.04713,
title = {Not Every Subject Should Stay: Machine Unlearning for Noisy Engagement Recognition},
author = {Alexander Vedernikov},
journal= {arXiv preprint arXiv:2605.04713},
year = {2026}
}