中文

面向视频互动的隐私保护型共情检测

计算机视觉与模式识别 2026-05-07 v3 人机交互 机器学习

摘要

从视频互动中检测共情具有新兴的应用前景,但用于训练 AI 模型的原始视频因隐私和伦理限制几乎无法获取。因此,公开基准数据集仅以预提取的特征形式发布,形成一种受限隐私的学习环境,其隐私-效用权衡尚未得到充分 characterization。我们正式化了视频基于行为预测的三级隐私——无隐私(原始视频)、部分隐私(如面部关键点、动作单元和眼神注意力等的时序视觉特征)以及强隐私(这些特征的汇总统计信息),并探讨了在强隐私层级是否可以实现强数据驱动的共情检测。我们提出 TFMPathy,其基于两个最新的表格基础模型 (TFMs) (TabPFN v2 和 TabICL),分别在基于情境学习和微调范式下实现。实验表明,在强隐私条件下,TFMPathy 能够实现卓越的效用,显著优于既有基线。为评估鲁棒性并促进公平、安全的部署,我们引入了此基准数据集中缺失的跨主体评估协议。在此协议下,TFM 微调显著提升了泛化能力(准确率:0.5900.7300.590 \rightarrow 0.730;AUC:0.5640.6690.564 \rightarrow 0.669)。将时序特征聚合为汇总统计信息还能抑制主体特定特征和人口学特征,使 TFMPathy 符合数据最小化原则。因此,TFMPathy 为在治理、知情同意或制度性政策限制下共享原始视频的场景中构建依赖于人类中心视频的 AI 系统提供了可行路径。项目页面:https://github.com/hasan-rakibul/TFMPathy

关键词

引用

@article{arxiv.2504.10808,
  title  = {Privacy-Preserving Empathy Detection in Video Interactions},
  author = {Md Rakibul Hasan and Md Zakir Hossain and Aneesh Krishna and Shafin Rahman and Tom Gedeon},
  journal= {arXiv preprint arXiv:2504.10808},
  year   = {2026}
}