中文

借助监督性文档的多模态情景中的共情水平预测

人工智能 2025-12-03 v1

摘要

流行的共情预测技术主要集中于单一模态,通常是文本,因而忽略了多模态处理能力。它们也忽视了利用某些特权信息的可能性,这些信息可能包含额外的共情内容。为此,我们引入了一种先进的多模态共情预测方法,集成了视频、音频和文本信息。该方法包括多模态共情预测和监督性文档辅助训练。我们使用预训练网络在共情预测网络中提取各种模态的特征,随后进行跨模态融合。这一过程产生多模态特征表示,用于预测共情标签。为增强文本特征的提取,我们在辅助训练阶段将监督性文档作为特权信息加以融入。具体而言,我们应用潜在狄利克雷分配模型识别潜在主题分布,以约束文本特征。这些监督性文档由监督者创建,聚焦于咨询主题以及顾问展示共情的方式。值得注意的是,这些特权信息仅在训练期间可用,在预测阶段不可访问。实验结果表明,在多模态和对话共情数据集上,我们的方法优于现有方法。

关键词

引用

@article{arxiv.2512.02558,
  title  = {Empathy Level Prediction in Multi-Modal Scenario with Supervisory Documentation Assistance},
  author = {Yufei Xiao and Shangfei Wang},
  journal= {arXiv preprint arXiv:2512.02558},
  year   = {2025}
}