AdvisorQA: 迈向有益且无害的寻求建议问答与集体智能
计算与语言
2025-02-04 v2
摘要
随着大型语言模型在日常生活中的集成日益增多,在主观和个人困境方面提供建议的基准存在明显空白。为了解决这个问题,我们引入了AdvisorQA,这是第一个用于评估LLM在提供深度个性化问题建议方面能力的基准,利用了LifeProTips子论坛。该论坛具有动态交互的特点,用户发布寻求建议的问题,每个查询平均获得8.9条建议,来自数百名用户的164.2个赞,体现了一个集体智能框架。因此,我们完成了一个包含日常生活问题、多样化的相应回答和多数投票排名的基准,以训练我们的有用性度量。基线实验通过我们的有用性度量、GPT-4和人工评估验证了AdvisorQA的有效性,分析了有用性和无害性权衡之外的现象。AdvisorQA标志着在增强QA系统以提供个性化、共情建议方面的重要飞跃,展示了LLM对人类主观性理解的提升。
引用
@article{arxiv.2404.11826,
title = {AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective Intelligence},
author = {Minbeom Kim and Hwanhee Lee and Joonsuk Park and Hwaran Lee and Kyomin Jung},
journal= {arXiv preprint arXiv:2404.11826},
year = {2025}
}
备注
19 pages, 11 figures