大语言模型并非你所需要的一切
计算与语言
2024-01-02 v1 人工智能
机器学习
摘要
本文描述了为解决 SemEval 2023 任务 2:MultiCoNER II(多语言复杂命名实体识别)[1] 而构建的架构和系统。我们评估了两种方法:传统条件随机场模型和带有自定义头部进行微调的大语言模型(LLM),并比较了这两种方法。探索的新思路如下:1)衰减辅助损失(带残差)——我们在粗粒度 NER 的辅助任务上训练模型,并将此任务作为损失函数的一部分;2)三元组词元混合——我们探索在预测前的最终 NER 层中混合相邻词元嵌入的方法;3)任务最优头部——我们为 LLM 的最后一层探索了多种自定义头部和学习率。我们还探索了包括 GPT-3 在内的多种 LLM,并尝试了多种 dropout 和其他超参数设置,最终确定的模型在开发集上实现了 0.85/0.84 的微观与宏观 F1 分数,在测试数据上实现了 0.67/0.61 的分数。我们表明,尽管预训练 LLM 本身相比传统模型带来了分数的大幅提升,但我们也证明了通过使用上述额外的特征/损失/模型工程技术增强 LLM,可以对 Macro-F1 分数产生实质性改善。
引用
@article{arxiv.2401.00698,
title = {Large Language Models aren't all that you need},
author = {Kiran Voderhobli Holla and Chaithanya Kumar and Aryan Singh},
journal= {arXiv preprint arXiv:2401.00698},
year = {2024}
}