World Models
arXiv
AI READING NOTE
论文探索强化学习智能体能否先学习环境的生成模型,再利用内部模拟训练策略。世界模型以无监督方式压缩环境的空间与时间结构,策略网络只需读取这些表征,因此可以保持非常紧凑。作者进一步让智能体完全在世界模型生成的“梦境”中训练,再把策略迁移回真实环境并完成任务,直观展示了利用内部环境表征进行想象、规划和控制的研究范式。
站内已收录 1 篇使用该方法的论文。
题目 · 作者 · 年份 · 发表来源 · 原始摘要 · AI导读
arXiv
论文探索强化学习智能体能否先学习环境的生成模型,再利用内部模拟训练策略。世界模型以无监督方式压缩环境的空间与时间结构,策略网络只需读取这些表征,因此可以保持非常紧凑。作者进一步让智能体完全在世界模型生成的“梦境”中训练,再把策略迁移回真实环境并完成任务,直观展示了利用内部环境表征进行想象、规划和控制的研究范式。