基于稠密检索和重排序模型的多语言幽默感知检索
信息检索
2026-05-26 v1
摘要
幽默感知的信息检索带来了超越标准语义检索的独特挑战,因为系统不仅需要考虑主题相关性,还必须考虑幽默特有的语言现象,如文字游戏、语音歧义和一词多义。在本文中,DUTH团队使用CLEF 2025 JOKER任务1基准研究多语言幽默感知信息检索,该基准评估英语和葡萄牙语的幽默检索。我们的方法将基于多语言XLM-RoBERTa的稠密检索与额外的系统变体(包括神经重排序)相结合,以评估通用Transformer模型能在多大程度上捕捉幽默特定的相关性。结果揭示了显著的跨语言差异。虽然葡萄牙语运行在MAP、MRR和早期精确率指标上表现出相对较强的性能,但英语运行的表现明显更差,相关的幽默文档经常出现在较低的排名中。这些发现凸显了纯语义稠密表示在幽默检索中的局限性,特别是当幽默依赖于多语言编码器未明确建模的表层线索时。我们进一步分析了导致这种差异的因素,包括数据集特征、查询-文档对齐以及幽默机制的变化。总体而言,DUTH团队的实验建立了多语言稠密检索和重排序基线,并提供了对在JOKER框架内建模幽默感知相关性挑战的见解。
引用
@article{arxiv.2605.25165,
title = {Multilingual Humour-Aware Retrieval with Dense and Re-Ranking Models},
author = {Georgios Arampatzis and Avi Arampatzis},
journal= {arXiv preprint arXiv:2605.25165},
year = {2026}
}
备注
8 pages