中文

合成多模态文本与图像数据的情感控制反馈

多媒体 2025-10-07 v4 人工智能

摘要

生成针对包含文本和图像的多模态输入的情感控制反馈的能力,解决了人机交互中的一个关键缺口。这种能力使系统能够提供富有同理心、准确且引人入胜的响应,在教育、医疗保健、营销和客户服务中具有有用的应用。为此,我们构建了一个大规模的可控多模态反馈合成 (CMFeed) 数据集,并提出了一种可控反馈合成系统。该系统包含用于文本和视觉输入的编码器、解码器和可控性模块。它利用 Transformer 和 Faster R-CNN 网络提取特征,并将它们结合以生成反馈。CMFeed 数据集包括图像、文本、对帖子的反应、带有相关性评分的人类评论以及对这些评论的反应。这些反应训练模型产生具有指定情感的反馈,实现了 77.23% 的情感分类准确率,比无可控性时的准确率高出 18.82%。CMFeed 数据集和系统代码可在 https://github.com/MIntelligence-Group/CMFeed 获取。

关键词

引用

@article{arxiv.2402.07640,
  title  = {Synthesizing Sentiment-Controlled Feedback For Multimodal Text and Image Data},
  author = {Puneet Kumar and Sarthak Malik and Balasubramanian Raman and Xiaobai Li},
  journal= {arXiv preprint arXiv:2402.07640},
  year   = {2025}
}