L3Cube-MahaEmotions:使用 CoTR 提示与大型语言模型合成标注的马拉地语情感识别数据集
计算与语言
2025-09-01 v2 机器学习
摘要
由于标注数据有限,马拉地语等低资源语言的情感识别仍具挑战性。我们提出 L3Cube-MahaEmotions,一个具有 11 个细粒度情感标签的高质量马拉地语情感识别数据集。训练数据使用大型语言模型(LLM)进行合成标注,而验证集和测试集则由人工标注,以作为可靠的金标准基准。在 MahaSent 数据集的基础上,我们应用了翻译链提示技术,将马拉地语句子翻译为英语并通过单个提示进行情感标注。我们评估了 GPT-4 和 Llama3-405B,由于标签质量更优,GPT-4 被选用于训练数据标注。我们使用标准指标评估模型性能,并探索了标签聚合策略(如 Union、Intersection)。尽管 GPT-4 的预测优于微调的 BERT 模型,但基于合成标签训练的 BERT 模型未能超越 GPT-4。这凸显了高质量人工标注数据的重要性以及情感识别固有的复杂性。本项工作的一个重要发现是,对于复杂的低资源情感识别任务,GPT-4 和 Llama3-405B 等通用 LLM 比微调的 BERT 具有更好的泛化能力。数据集和模型已在 https://github.com/l3cube-pune/MarathiNLP 公开共享。
关键词
引用
@article{arxiv.2506.00863,
title = {L3Cube-MahaEmotions: A Marathi Emotion Recognition Dataset with Synthetic Annotations using CoTR prompting and Large Language Models},
author = {Nidhi Kowtal and Raviraj Joshi},
journal= {arXiv preprint arXiv:2506.00863},
year = {2025}
}