微调与提示调优:语言模型能否理解人类价值观?
计算与语言
2024-03-18 v1 人工智能
摘要
准确处理句子中潜在的支持性价值观对于理解说话者的倾向具有关键意义,却是自然语言理解(NLU)中具有挑战性的任务。本文探讨了在该下游任务中使用人类价值检测2023数据集进行微调和提示调优的潜力。此外,我们尝试验证模型是否能够基于预训练阶段获得的知识有效地解决该问题。同时,我们关注与强化学习人类反馈(RLHF)对齐的大语言模型(LLM)在该任务中的能力,并呈现了一些初步尝试。
引用
@article{arxiv.2403.09720,
title = {Fine-tuning vs Prompting, Can Language Models Understand Human Values?},
author = {Pingwei Sun},
journal= {arXiv preprint arXiv:2403.09720},
year = {2024}
}