中文

多轮LLM健康 coaching 的离线策略评估

人工智能 2025-10-22 v2 计算与语言

摘要

我们研究了一个部署于网页的、带工具的 LLM 健康教练。针对七名用户(280 条评级轮次)进行的 pilot 表明,针对分解决策头部 (Tool/Style) 的离线策略评估 (OPE) 显示,统一的重型工具策略会提高日志中平均值,但会损害特定子群,尤其是低健康素养/高自我效能感用户。一个轻量级模拟器带有隐藏原型进一步表明,添加小的早期信息增益奖励可可靠地缩短特征识别时间,并提高目标成功率和 pass@3。综上,这些早期发现表明一条以评估为导向的个人化路径:冻结生成器,在类型化奖励上(客观工具结果和满意度)学习子群感知决策头部,始终报告按原型的指标,以揭示平均值掩盖的子群伤害。

关键词

引用

@article{arxiv.2510.17173,
  title  = {Offline Policy Evaluation of Multi-Turn LLM Health Coaching with Real Users},
  author = {Melik Ozolcer and Sang Won Bae},
  journal= {arXiv preprint arXiv:2510.17173},
  year   = {2025}
}

备注

Accepted to the NeurIPS 2025 Workshop on Multi-Turn Interactions in Large Language Models