在多语言和多领域设置中调查大语言模型用于复杂词识别
计算与语言
2024-11-05 v1
摘要
复杂词识别(CWI)是词汇简化任务中的关键步骤,最近已成为一项独立任务。这种二元分类任务出现了一些变体,如词汇复杂度预测(LCP)和多词表达复杂度评估(MWE)。大语言模型(LLM)最近在自然语言处理领域因其多功能性和在零样本/少样本设置中解决未见任务的能力而变得流行。我们的工作研究了LLM的使用,具体包括开源模型如Llama 2、Llama 3和Vicuna v1.5,以及闭源模型如ChatGPT-3.5-turbo和GPT-4o,在CWI、LCP和MWE设置中的应用。我们评估了零样本、少样本和微调设置,结果表明LLM在某些条件下表现不佳,或与现有方法达到可比结果。此外,我们提供了一些关于元学习与提示学习结合的观点。最终,我们得出结论,当前LLM的现状无法或几乎无法超越通常规模小得多的现有方法。
引用
@article{arxiv.2411.01706,
title = {Investigating Large Language Models for Complex Word Identification in Multilingual and Multidomain Setups},
author = {Răzvan-Alexandru Smădu and David-Gabriel Ion and Dumitru-Clementin Cercel and Florin Pop and Mihaela-Claudia Cercel},
journal= {arXiv preprint arXiv:2411.01706},
year = {2024}
}
备注
37 pages, 16 figures, Accepted by EMNLP 2024