面向越南语多模态方面类别情感分析的新基准数据集与细粒度跨模态融合框架
计算与语言
2025-04-08 v1 人工智能
摘要
社交媒体平台上多模态数据的出现为更好地理解用户对特定方面的情感提供了新的机会。然而,现有的用于方面类别情感分析(ACSA)的多模态数据集通常侧重于文本标注,忽略了图像中的细粒度信息。因此,这些数据集未能充分利用多模态固有的丰富性。为了解决这个问题,我们引入了一个新的越南语多模态数据集,命名为ViMACSA,它包含4,876个文本-图像对,在酒店领域对文本和图像进行了14,618个细粒度标注。此外,我们提出了一个细粒度跨模态融合框架(FCMF),该框架有效地学习了模态内和模态间的交互,然后融合这些信息以产生统一的多模态表示。实验结果表明,我们的框架在ViMACSA数据集上优于SOTA模型,达到了79.73%的最高F1分数。我们还探讨了越南语多模态情感分析的特点和挑战,包括拼写错误、缩写以及越南语的复杂性。这项工作既贡献了一个基准数据集,也贡献了一个利用细粒度多模态信息来改进多模态方面类别情感分析的新框架。我们的数据集可用于研究目的:https://github.com/hoangquy18/Multimodal-Aspect-Category-Sentiment-Analysis。
引用
@article{arxiv.2405.00543,
title = {New Benchmark Dataset and Fine-Grained Cross-Modal Fusion Framework for Vietnamese Multimodal Aspect-Category Sentiment Analysis},
author = {Quy Hoang Nguyen and Minh-Van Truong Nguyen and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2405.00543},
year = {2025}
}