中文

我们能否利用大语言模型(LLM)来引导强化学习?——数字健康行为改变中的案例研究

机器学习 2025-11-25 v1 人工智能 人机交互

摘要

个性化数字健康行为干预是提升其参与度和效果的有前景之路。这一点尤其适用于能够随时间针对用户及其特定状态(如动机、知识、需求)进行适应性调整的方案。然而,这类方案的开发需要作出诸多设计选择,而这些选择的有效性难以从文献中预测,且在实践中评估成本高昂。本文探讨了是否可以将大语言模型(LLM)开箱即用,用于生成用户交互样本,以为训练面向数字行为改变场景的强化学习模型提供有用信息。我们使用来自四个大型行为改变研究的真实用户数据进行比较,表明在缺乏真实数据时,LLM生成的样本仍具实用性。与人类评审者提供的样本进行比较后发现,LLM生成的样本的性能与人类评审者相当。进一步分析了不同提示策略(包括更短和更长的提示变体、链式思考提示和few-shot提示),表明不同策略的相对有效性取决于具体研究场景和所使用的LLM模型,提示术语之间的差异也相当显著。我们提供了LLM生成样本在实际中发挥作用的建议。

关键词

引用

@article{arxiv.2511.17630,
  title  = {Can we use LLMs to bootstrap reinforcement learning? -- A case study in digital health behavior change},
  author = {Nele Albers and Esra Cemre Su de Groot and Loes Keijsers and Manon H. Hillegers and Emiel Krahmer},
  journal= {arXiv preprint arXiv:2511.17630},
  year   = {2025}
}