首页 > 其他 > 详细

针对PPO的一些Code-level性能优化技巧

时间：2020-11-24 19:03:07 阅读：56 评论：0 收藏：0 [点我收藏+]

Intro

这篇blog是我在看过Logan等人的“implementation matters in deep policy gradients: a case study on ppo and trpo“之后的总结。

value function clipping

reward scaling

orthogonal initialization and layer scaling

adam learning rate annealing

reward clipping

observation clipping

hyperbolic tan activations

global gradient clipping

针对PPO的一些Code-level性能优化技巧

原文：https://www.cnblogs.com/dynmi/p/14031724.html

踩

(0)

赞

(0)

举报

评论一句话评论（0）

分享档案

更多>

2021年09月23日 (328)
2021年09月24日 (313)
2021年09月17日 (191)
2021年09月15日 (369)
2021年09月16日 (411)
2021年09月13日 (439)
2021年09月11日 (398)
2021年09月12日 (393)
2021年09月10日 (160)
2021年09月08日 (222)

最新文章

更多>

教程昨日排行

更多>

友情链接

汇智网 PHP教程插件网

关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com

© 2014 bubuko.com 版权所有

打开技术之扣，分享程序人生！