中文

1-800-SHARED-TASKS @ 天城文脚本语言的 NLU:基于 LLM 的语言、仇恨言论和目标检测

计算与语言 2024-11-12 v1 人工智能 机器学习

摘要

本文详细介绍了我们在 CHiPSAL 2025 共享任务中的系统提交,重点关注天城文脚本语言中的语言检测、仇恨言论识别和目标检测。我们实验了大型语言模型及其组合,包括 MuRIL、IndicBERT 和 Gemma-2,并利用了诸如焦点损失等独特技术,以应对天城文语言自然语言理解中的挑战,如多语言处理和类别不平衡。我们的方法在所有任务上取得了具有竞争力的结果:子任务 A、B 和 C 的 F1 分别为 0.9980、0.7652 和 0.6804。这项工作提供了关于 Transformer 模型在具有领域特定和语言挑战的任务中有效性的见解,以及未来迭代中潜在的改进方向。

关键词

引用

@article{arxiv.2411.06850,
  title  = {1-800-SHARED-TASKS @ NLU of Devanagari Script Languages: Detection of Language, Hate Speech, and Targets using LLMs},
  author = {Jebish Purbey and Siddartha Pullakhandam and Kanwal Mehreen and Muhammad Arham and Drishti Sharma and Ashay Srivastava and Ram Mohan Rao Kadiyala},
  journal= {arXiv preprint arXiv:2411.06850},
  year   = {2024}
}

备注

13 pages, Submitted to CHIPSAL workshop @ COLING 2025