乐观、期望,还是讽刺?西班牙语和英语中的多类别希望语检测
计算与语言
2025-05-07 v2
摘要
希望是一种复杂且未被充分探索的情感状态,在教育、心理健康和社交互动中发挥重要作用。与基本情感不同,希望呈现细微形式,从现实的乐观到夸张的愿望或讽刺,使其对自然语言处理系统的准确检测具有挑战性。本研究引入了 PolyHope V2,一个包含超过 30,000 条标注推文的多语言、细粒度希望语数据集,覆盖英语和西班牙语。该资源区分四种希望子类型:Generalized(广义)、Realistic(现实)、Unrealistic(不切实际)和 Sarcastic(讽刺),并对现有数据集进行了增强,显式标注讽刺实例。我们对多个预训练转换器模型进行基准测试,并与大型语言模型(LLM)如 GPT-4 和 Llama 3 在零样本和少样本情境下进行比较。我们的发现表明,微调后的转换器模型在区分细微的希望类别和讽刺方面优于基于提示的 LLM。通过定性分析和混淆矩阵,我们突出了在分离紧密相关希望子类型方面的系统性挑战。该数据集和结果为未来需要更大语义和上下文灵敏度的情感识别任务提供了坚实基础。
引用
@article{arxiv.2504.17974,
title = {Optimism, Expectation, or Sarcasm? Multi-Class Hope Speech Detection in Spanish and English},
author = {Sabur Butt and Fazlourrahman Balouchzahi and Ahmad Imam Amjad and Maaz Amjad and Hector G. Ceballos and Salud Maria Jimenez-Zafra},
journal= {arXiv preprint arXiv:2504.17974},
year = {2025}
}