分析风险选择:Deal or No Deal 中的 Q 学习
应用统计
2011-10-06 v1
摘要
我们在流行的 Deal or No Deal 电视节目中推导了一种最优策略。Q 学习量化了序贯决策中固有的延续价值,我们据此来分析参赛者的风险选择。给定他们的选择与最优策略,我们反推以得到其风险厌恶水平的隐含界。在风险决策方面,先前的经验证据表明,过去的结果会影响未来的选择,且参赛者具有随时间变化的风险厌恶。我们证明,欧洲版节目中两位选手(Suzanne 与 Frank)的策略与恒定的风险厌恶水平相一致,仅在其最后一次风险寻求选择处出现例外。
引用
@article{arxiv.1110.0883,
title = {Analyzing Risky Choices: Q-Learning for Deal-No Deal},
author = {Laszlo Korsos and Nicholas G. Polson},
journal= {arXiv preprint arXiv:1110.0883},
year = {2011}
}