中文

面向低资源巴兰语的基于 Transformer 的三模态融合框架用于提升多模态作者意图分类

机器学习 2025-12-01 v1 计算与语言

摘要

互联网和社交网络的扩展导致用户生成内容的激增。作者意图理解在解释社交媒体内容方面发挥关键作用。本文针对巴兰语社交媒体帖子的作者意图分类,利用文本和视觉数据。鉴于前述单模态方法的局限性,我们系统评估了基于 Transformer 的语言模型(mBERT、DistilBERT、XLM-RoBERTa)和视觉架构(ViT、Swin、SwiftFormer、ResNet、DenseNet、MobileNet),使用覆盖六个实际意图类别的 Uddessho 数据集进行基准测试。我们引入一种新颖的中间融合策略,显著优于早期和晚期融合。实验结果表明,尤其是使用 mBERT 和 Swin Transformer 的中间融合,达到 84.11% 的宏平均 F1 分数,较先前的巴兰语多模态方法提升了 8.4 个百分点,建立了新的状态最佳成绩。我们的分析表明,整合视觉上下文显著增强了意图分类。在模态特定表征与跨模态学习之间,跨模态特征在中间层的集成提供了最佳平衡。该研究为巴兰语及其他低资源语言建立了新的基准和方法学标准。我们将所提出的框架称为 BangACMM(Bangla Author Content MultiModal)。

关键词

引用

@article{arxiv.2511.23287,
  title  = {Transformer-Driven Triple Fusion Framework for Enhanced Multimodal Author Intent Classification in Low-Resource Bangla},
  author = {Ariful Islam and Tanvir Mahmud and Md Rifat Hossen},
  journal= {arXiv preprint arXiv:2511.23287},
  year   = {2025}
}

备注

Accepted at the 28th International Conference on Computer and Information Technology (ICCIT 2025). To be published in IEEE proceedings