The AI Economist: Taxation policy design via two-level deep multiagent reinforcement learning
Science Advances
论文提出两层深度多智能体强化学习框架:经济主体与社会规划者共同适应,前者学习劳动和交易行为,后者学习税收政策,并用课程学习稳定这一双层优化。在一步经济中,模型能够恢复理论最优税制;在时空经济中,相较基准方法提高了功利主义福利以及公平—生产率权衡。结果同时出现劳动专业化、行为变化和避税策略,说明政策优化必须内生考虑主体对制度的策略性响应。
