视频中的面部动力学:面向改进面部表情感知与情境意识的指令调优
计算机视觉与模式识别
2025-01-15 v1 人工智能
摘要
面部表情描述已在多个领域得到广泛应用。近期,视频多模态大语言模型(MLLM)在一般视频理解任务中显示出前景。然而,描述视频中的面部表情对这些模型提出了两个主要挑战:(1)缺乏充足的数据集和基准;(2)视频MLLM的视觉标记容量有限。为此,本文引入一个新的遵循指令数据集,专为动态面部表情描述而设计。该数据集包含5033个高质量视频剪辑,手工标注,包含超过70万个标记。其目的是提高视频MLLM捕捉细微面部细节的能力。此外,我们提出FaceTrack-MM,利用有限的标记编码主角的面部。该模型在跟踪人脸和聚焦于多人场景中复杂情境下的面部表情方面表现优异。我们还引入一种新型评估指标,结合事件抽取、关系分类和最长公共子序列(LCS)算法,以评估生成文本的内容一致性和时间序列一致性。此外,我们present了一个名为FEC-Bench的基准,旨在评估现有视频MLLM在此特定任务中的性能。所有数据和源代码将公开提供。
引用
@article{arxiv.2501.07978,
title = {Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness},
author = {Jiaxing Zhao and Boyuan Sun and Xiang Chen and Xihan Wei},
journal= {arXiv preprint arXiv:2501.07978},
year = {2025}
}