YouTube评论解码:利用大语言模型进行低资源语言分类
计算与语言
2025-03-14 v2 人工智能
摘要
讽刺检测是情感分析中的一项重大挑战,尤其是在其表达的观点含义与字面表达不一致时。在社交媒体语境中,这种挑战因语码混合(尤其在达罗毗荼语系语言中)而更加突出。语码混合涉及在单一话语中融合多种语言,常伴随非母语脚本,使针对单语数据训练的系统面临困难。本项任务引入了一个新颖的金标准语料库,专门用于语码混合文本中的讽刺与情感检测,具体涵盖泰米尔语-英语和马拉雅拉姆语-英语语言。该任务的主要目标是在从社交媒体平台收集的泰米尔语-英语和马拉雅拉姆语-英语评论与帖子构成的语码混合数据集中,识别讽刺并判断情感极性。每个评论或帖子在消息层面进行情感极性标注,特别关注类别不平衡带来的挑战,以反映真实场景。在本工作中,我们利用提示工程实验了最先进的大语言模型(如GPT-3.5 Turbo),将评论分类为讽刺或非讽刺类别。我们在泰米尔语上获得了0.61的macro-F1分数,在马拉雅拉姆语上获得了0.50的macro-F1分数。
引用
@article{arxiv.2411.05039,
title = {YouTube Comments Decoded: Leveraging LLMs for Low Resource Language Classification},
author = {Aniket Deroy and Subhankar Maity},
journal= {arXiv preprint arXiv:2411.05039},
year = {2025}
}
备注
Updated and Final Version