中文

历史卷笔:探索大语言模型用于19世纪西班牙语讽刺检测

计算与语言 2025-03-31 v1 人工智能 数字图书馆

摘要

本研究探讨了利用大语言模型(LLMs)来增强数据集并提高19世纪拉美报纸中讽刺检测的能力。通过多分类和二分类任务评估BERT和GPT-4o模型捕捉讽刺细微含义的效果。首先,我们实施了以增强情感和情境线索为目标的数据集改进措施;然而,这些措施在历史语言分析方面显示出有限的影响。第二种策略——半自动化标注流程——有效解决了类别不平衡问题,并高质量地增强了数据集。尽管讽刺的复杂性带来了挑战,但本工作通过两个关键贡献推动了情感分析的进步:引入一个新的历史西班牙语数据集,用于情感分析和讽刺检测;提出一种半自动化标注方法,其中人类专业知识对于细化LLMs结果至关重要,同时将历史和文化背景作为核心特征纳入其中。

关键词

引用

@article{arxiv.2503.22585,
  title  = {Historical Ink: Exploring Large Language Models for Irony Detection in 19th-Century Spanish},
  author = {Kevin Cohen and Laura Manrique-Gómez and Rubén Manrique},
  journal= {arXiv preprint arXiv:2503.22585},
  year   = {2025}
}