风险敏感报酬的变分公式
最优化与控制
2015-01-06 v1 信息论
math.IT
概率论
摘要
我们导出了离散时间马尔可夫决策过程在紧度量状态与动作空间下无限水平风险敏感控制问题中最优报酬增长率的变分公式,推广了 Donsker 与 Varadhan 关于正算子的 Perron-Frobenius 特征值的公式。这导出了确定该最优增长率问题的凹最大化表述。
引用
@article{arxiv.1501.00676,
title = {A variational formula for risk-sensitive reward},
author = {Venkatachalam Anantharam and Vivek Shripad Borkar},
journal= {arXiv preprint arXiv:1501.00676},
year = {2015}
}
备注
35 pages