中文

面向委婉语识别的面向关键词多模态建模

计算与语言 2025-03-28 v1 人工智能 计算机视觉与模式识别

摘要

委婉语识别旨在破译委婉语的真实含义,例如在非法文本中将“weed”(委婉语)与“marijuana”(目标关键词)联系起来,从而辅助内容审核并打击地下市场。现有方法主要基于文本,但随着社交媒体的兴起,凸显了融合文本、图像和音频的多模态分析的需求。然而,委婉语多模态数据集的缺乏限制了进一步研究。为此,我们将委婉语及其对应的目标关键词视为关键词,首次构建了面向关键词的委婉语多模态语料库(KOM-Euph),包含三个数据集(毒品、武器和性),涵盖文本、图像和语音。我们进一步提出了一种面向关键词的多模态委婉语识别方法(KOM-EI),该方法利用跨模态特征对齐和动态融合模块,显式利用关键词的视觉和音频特征以实现高效的委婉语识别。大量实验表明,KOM-EI 优于现有最先进模型和大型语言模型,并验证了我们多模态数据集的重要性。

关键词

引用

@article{arxiv.2503.21504,
  title  = {Keyword-Oriented Multimodal Modeling for Euphemism Identification},
  author = {Yuxue Hu and Junsong Li and Meixuan Chen and Dongyu Su and Tongguan Wang and Ying Sha},
  journal= {arXiv preprint arXiv:2503.21504},
  year   = {2025}
}