是什么让模型呼吸?理解生物力学用户仿真中的强化学习奖励函数设计
人机交互
2025-03-05 v1
摘要
生物力学模型允许对交互中的用户运动进行多样化仿真。其性能在关键程度上取决于奖励函数的精心设计,然而奖励组件与涌现行为之间的相互作用仍不甚明了。我们通过系统分析奖励努力最小化、任务完成和目标接近度对运动轨迹的影响,研究了是什么让模型“呼吸”。使用选择反应任务作为测试平台,我们发现完成奖励与接近度激励的组合对于任务成功至关重要。努力项是可选的,但如果缩放适当,可以帮助避免不规则性。我们的工作为 HCI 设计者提供了实用见解,使其无需深厚的强化学习专业知识即可创建逼真的仿真,从而推动仿真成为 HCI 中交互设计与评估的强大工具。
引用
@article{arxiv.2503.02571,
title = {What Makes a Model Breathe? Understanding Reinforcement Learning Reward Function Design in Biomechanical User Simulation},
author = {Hannah Selder and Florian Fischer and Per Ola Kristensson and Arthur Fleig},
journal= {arXiv preprint arXiv:2503.02571},
year = {2025}
}
备注
10 pages, 3 figures, 2 tables; CHI 25 LBW