中文

方言?我几乎不认识她:风格控制与刻板印象的挑战

计算与语言 2024-06-19 v1

摘要

大型语言模型(LLM)越来越多地被用于教育和学习应用。研究表明,控制风格以适应学习者的需求,有助于增进理解、促进包容并帮助知识提炼。为了解当代LLM在风格控制方面的能力和局限性,我们评估了五个最先进的模型:GPT-3.5、GPT-4、GPT-4o、Llama-3和Mistral-instruct-7B,涉及两个风格控制任务。在第一个任务中,我们观察到显著的不一致性,模型在针对一年级学生的任务中平均表现介于5至8年级阅读水平之间,标准差高达27.6。对于第二个任务,我们观察到性能从0.02到0.26有统计学上显著的提升。然而,我们发现即使参考文本中没有刻板印象,LLM在任务过程中也经常生成文化上不敏感的内容。我们对结果进行了深入分析和讨论。

关键词

引用

@article{arxiv.2406.12679,
  title  = {Vernacular? I Barely Know Her: Challenges with Style Control and Stereotyping},
  author = {Ankit Aich and Tingting Liu and Salvatore Giorgi and Kelsey Isman and Lyle Ungar and Brenda Curtis},
  journal= {arXiv preprint arXiv:2406.12679},
  year   = {2024}
}