中文

面向伦理模糊性的语言模型微调:人类响应对齐比较研究

计算与语言 2024-10-11 v1

摘要

语言模型常因处理模糊性而误解人类意图,这一局限性在NLP研究中已广为人知。虽然在道德明确的情景下LLMs更容易判断,但在道德模糊的情境中则面临更大挑战。本研究探索了LLM校准,旨在显示人类与LLM在此类情境下的判断存在较差的对齐性。我们使用来自Scruples项目的两个精选数据集进行评估:DILEMMAS数据集涉及一对不同道德情景,用于评估模型比较和对比伦理情境的能力;ANECDOTES数据集呈现个人叙事,以评估模型提取细节、解释和分析不同道德情境的能力。我们提取模型对所有可能选择的答案概率,并与人类标注进行比较,以对三种模型(Llama-3.1-8b、Zephyr-7b-beta和Mistral-7b)的对齐程度进行基准测试。在微调后观察到显著改进,尤其在Dirichlet分数方面表现显著,后者尤其突出。值得注意的是,在微调后,Mistral-7B-Instruct-v0.3的表现与GPT-4o相当。然而,所检查的实验模型在交叉熵分数方面仍被BERT和RoBERTa模型所超越。我们的方法通过改进模型对文本分布的理解(以文本到文本格式),有效提升了在复杂决策情境中的性能和对齐性,凸显了进一步研究以细化伦理推理技术并捕捉人类判断细微差别的必要性。

关键词

引用

@article{arxiv.2410.07826,
  title  = {Fine-Tuning Language Models for Ethical Ambiguity: A Comparative Study of Alignment with Human Responses},
  author = {Pranav Senthilkumar and Visshwa Balasubramanian and Prisha Jain and Aneesa Maity and Jonathan Lu and Kevin Zhu},
  journal= {arXiv preprint arXiv:2410.07826},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024, SoLaR workshop