基于自验证方法的情感知识增强:面向视觉大语言模型的高质量情感指令数据生成
机器学习
2025-05-27 v1 图形学
摘要
面部情感感知是视觉大语言模型 (VLLM) 中的关键任务,以实现自然的人机交互。然而,为粗粒度和细粒度面部情感分析创建高质量注释需要昂贵的专业知识。缺乏高质量指令数据限制了 VLLM 在面部情感感知方面的性能。为此,我们提出一种情感知识增强的自验证方法 (SEKE),通过闭源 VLLM 以成本效益高的方式生成用于多粒度情感分析的高质量指令数据。该方法将先验人类知识整合到 VLLM 推理中,依据情感描述三个粒度水平(离散表情、价值-唤醒度和动作单元)之间的内在关联,可靠地生成全面注释。进一步嵌入基于不确定性蒙特卡洛抽样的自验证策略 (SV-UAMC),高效提取更准确的 VLLM 预测,从而进一步提高注释可靠性。因此,我们构建了一个包含三个全面描述的面部情感指令数据集 (FEID),为有效的模型训练提供粗粒度和细粒度情感信息。此外,我们引入了一个面部情感分析基准 (FEAB) 来衡量 VLLM 的相应能力。我们的方法在三个下游面部情感分析任务上显著优于最先进的方法。
引用
@article{arxiv.2505.18168,
title = {Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation},
author = {Feifan Wang and Tengfei Song and Minggui He and Chang Su and Zhanglin Wu and Hao Yang and Wenming Zheng and Osamu Yoshie},
journal= {arXiv preprint arXiv:2505.18168},
year = {2025}
}