从《瓦坎达》到《指环》:控制大语言模型内容生成的语言熟练度
计算与语言
2024-06-06 v1 机器学习
摘要
我们研究了控制大语言模型 (LLM) 生成文本难度级别的问题,特别是在目标用户尚不够熟练的情境中,例如语言学习者。通过一种新型框架,我们评估了几种关键方法的有效性,包括 few-shot 提示、监督微调和强化学习 (RL),分别利用 GPT-4 和开源替代方案如 LLama2-7B 和 Mistral-7B。我们的发现表明,GPT-4 与开源模型在基于提示的策略之间存在显著的性能差距。然而,我们展示了如何通过精心组合微调和 RL 对齐来弥合这一差距。我们的最佳模型 CALM (CEFR-Aligned Language Model) 在性能上超过了 GPT-4 和其他策略,仅需极少的成本。我们进一步通过小规模的人类研究验证了结果的质量。
引用
@article{arxiv.2406.03030,
title = {From Tarzan to Tolkien: Controlling the Language Proficiency Level of LLMs for Content Generation},
author = {Ali Malik and Stephen Mayhew and Chris Piech and Klinton Bicknell},
journal= {arXiv preprint arXiv:2406.03030},
year = {2024}
}