OmniMER:基于 Qwen2.5-Omni 的印尼语多模态情感识别的辅助增强适配
机器学习
2026-02-11 v3 人工智能
多媒体
摘要
印尼语作为超过两亿人的常用语言,在多模态情感识别研究中仍存在服务不足的问题,尽管其在东南亚社交媒体平台上占据主导地位。我们提出 IndoMER,这是首个面向印尼语的多模态情感识别基准数据集,包含 1,944 个视频片段,来自 203 位说话者,拥有在七个情感类别下对齐的文本、音频和视觉标注。该数据集包含现实中的挑战,包括跨模态不一致和由印尼文化交流规范塑造的长尾类别分布。为解决这些挑战,我们提出 OmniMER,一种基于 Qwen2.5-Omni 的多模态适配框架,通过三项模态特定感知任务来增强情感识别:用于文本的情感关键词提取、用于视频的面部表情分析以及用于音频的韵律分析。这些辅助任务帮助模型在融合前识别每个模态中的情感相关线索,从而减少在低资源环境中对虚假关联的依赖。在 IndoMER 数据集上的实验表明,OmniMER 在情感分类上实现了 0.582 的 Macro-F1,在情感识别上实现了 0.454,分别比基础模型提升了 7.6 和 22.1 个绝对值。对中国 CH-SIMS 数据集的跨语言评估进一步证明了所提框架的通用性。该数据集和代码已公开 disponible。https://github.com/yanxm01/INDOMER
引用
@article{arxiv.2512.19379,
title = {OmniMER: Auxiliary-Enhanced LLM Adaptation for Indonesian Multimodal Emotion Recognition},
author = {Xueming Yan and Boyan Xu and Yaochu Jin and Lixian Xiao and Wenlong Ye and Runyang Cai and Zeqi Zheng and Jingfa Liu and Aimin Yang and Yongduan Song},
journal= {arXiv preprint arXiv:2512.19379},
year = {2026}
}