揭示语言模型嵌入中潜在的人类福祉
计算与语言
2024-02-20 v1 人工智能
机器学习
摘要
语言模型是否隐式学习了人类福祉的概念?我们通过ETHICS功利主义任务探索这一点,评估扩展是否增强了预训练模型的表示。我们的初步发现表明,无需任何提示工程或微调,来自OpenAI的text-embedding-ada-002的主成分在73.9%的准确率上达到领先。这非常接近在完整ETHICS数据集上微调的BERT-large的74.6%,表明预训练传达了一些关于人类福祉的理解。接下来,我们考虑四个语言模型家族,观察功利主义准确率如何随参数增加而变化。我们发现,当使用足够数量的主成分时,性能随模型规模增大而非递减。
引用
@article{arxiv.2402.11777,
title = {Uncovering Latent Human Wellbeing in Language Model Embeddings},
author = {Pedro Freire and ChengCheng Tan and Adam Gleave and Dan Hendrycks and Scott Emmons},
journal= {arXiv preprint arXiv:2402.11777},
year = {2024}
}
备注
10 pages, 5 figures, 1 table