所有随机鹦鹉在模仿谁?它们应该告诉我们!
计算与语言
2024-10-30 v2 机器学习
摘要
无论是独立的语言模型(LM)还是下游任务系统中的LM,都已被证明会生成事实错误的陈述。对于低资源语言,该问题尤为严重,因为其训练数据稀缺且质量不如高资源语言。在这篇观点文章中,我们认为当前状态下的LM在关键场景中永远无法完全可信,并提出了一种可能的应对新策略:构建能够引用其来源的LM——即向用户指出支持其输出的训练数据部分。我们首先讨论当前哪些NLP任务会或不会受益于此类模型。接着我们强调此类模型将带来的预期益处,例如陈述的快速可验证性。最后我们概述在开发具备引用能力的LM道路上需要解决的各个子任务。我们希望就本领域当前构建LM的方法(尤其是针对低资源语言)以及训练数据在解释模型生成中的作用展开讨论。
引用
@article{arxiv.2310.10583,
title = {Who Are All The Stochastic Parrots Imitating? They Should Tell Us!},
author = {Sagi Shaier and Lawrence E. Hunter and Katharina von der Wense},
journal= {arXiv preprint arXiv:2310.10583},
year = {2024}
}
备注
Accepted to IJCNLP-AACL 2023