Phasic

Phasic Policy Gradient

**发表时间：**2021（ICML 2021） **文章要点：**这篇文章想说，通常强化都有一个policy网络一个value网络，这两部分要么分开训两个网络，要么合到一起作为一个网络的两个头。分开的好处是policy和value互相不会影响，合到一起的好处是feature是共享的，训练的时候相互 ......

Gradient Phasic Policy更新时间 2023-04-06

共1篇 :1/1页 首页上一页1下一页尾页

526互联

Phasic

Phasic Policy Gradient