FERGI:基于自发面部表情反应自动评分用户对文本到图像生成的偏好
计算机视觉与模式识别
2025-05-27 v4 人工智能
人机交互
机器学习
摘要
研究人员已提出利用人类偏好反馈数据来微调文本到图像生成模型。然而,人类反馈收集的可扩展性因其依赖人工标注而受到限制。因此,我们开发并测试了一种方法,通过用户对生成图像的自发面部表情反应来自动评分其偏好。我们收集了一个面部表情对生成图像反应数据集(FERGI),并表明多个面部动作单元(AUs)的激活与用户对生成图像的评价高度相关。我们开发了一个面部动作单元神经网络(FAU-Net),该网络接收来自AU估计模型的输入,基于用户的面部表情反应自动评分其对文本到图像生成的偏好,这与基于输入文本提示和生成图像的预训练评分模型互为补充。将我们的FAU-Net效价评分与预训练评分模型相结合,可提升其与人类偏好的一致性。这种基于面部表情分析的自动标注方法有望推广至其他生成任务。代码可在https://github.com/ShuangquanFeng/FERGI获取,数据集亦可在同一链接获取用于研究目的。
引用
@article{arxiv.2312.03187,
title = {FERGI: Automatic Scoring of User Preferences for Text-to-Image Generation from Spontaneous Facial Expression Reaction},
author = {Shuangquan Feng and Junhua Ma and Virginia R. de Sa},
journal= {arXiv preprint arXiv:2312.03187},
year = {2025}
}