中文

OID-PPO:基于变分策略优化将设计准则转化为奖励函数的优化室内设计

机器学习 2025-08-04 v1

摘要

住宅室内设计显著影响居住者满意度,但由于非结构化的空间布局、高计算需求以及依赖专家知识的局限性,仍然具有挑战性。现有基于优化或深度学习的方法要么计算昂贵,要么受数据稀缺的限制。强化学习方法常将家具放置限制在离散位置,并且未能充分融入设计原则。我们提出了OID-PPO(Optimal Interior Design using Proximal Policy Optimization),一种新的强化学习框架,通过变分策略优化实现最优室内设计,将专家定义的功能性和视觉指南整合到结构化奖励函数中。OID-PPO利用对角高斯策略实现连续且灵活的家具放置,在部分可观测性条件下有效探索潜在的环境动力学。在多样化的房间形状和家具配置实验中,结果表明OID-PPO在布局质量和计算效率方面显著优于最先进的方法。消融研究进一步证明了结构化指南整合的影响,揭示了各个设计约束的独特贡献。

关键词

引用

@article{arxiv.2508.00364,
  title  = {OID-PPO: Optimal Interior Design using Proximal Policy Optimization by Transforming Design Guidelines into Reward Functions},
  author = {Chanyoung Yoon and Sangbong Yoo and Soobin Yim and Chansoo Kim and Yun Jang},
  journal= {arXiv preprint arXiv:2508.00364},
  year   = {2025}
}