中文

在道德推理语言模型中引入类人偏差

人工智能 2024-11-26 v1 计算机与社会 机器学习

摘要

在这项工作中,我们研究了在行为数据和/或人类执行相同任务时的大脑数据上微调的大型语言模型(LLM)的对齐程度(BrainScore)。我们还探索了在人类进行道德推理时的fMRI数据上微调多个LLM是否能提高BrainScore。我们在ETHICS基准(Hendrycks等人,2020)的道德推理行为数据、Koster-Hale等人(2013)的道德推理fMRI数据,或两者上,对多个LLM(BERT、RoBERTa、DeBERTa)进行了微调。我们同时研究了模型在ETHICS基准上的准确率以及模型激活与fMRI数据之间的BrainScore。虽然较大的模型通常在这两个指标上表现更好,但微调并未显著提高BrainScore。

关键词

引用

@article{arxiv.2411.15386,
  title  = {Inducing Human-like Biases in Moral Reasoning Language Models},
  author = {Artem Karpov and Seong Hah Cho and Austin Meek and Raymond Koopmanschap and Lucy Farnik and Bogdan-Ionut Cirstea},
  journal= {arXiv preprint arXiv:2411.15386},
  year   = {2024}
}

备注

Accepted to the 2nd Workshop on Unifying Representations in Neural Models (UniReps) at NeurIPS 2024