526互联
首页
Ai
Java
Python
Android
Mysql
JavaScript
Html
CSS
Phasic
Phasic Policy Gradient
**发表时间:**2021(ICML 2021) **文章要点:**这篇文章想说,通常强化都有一个policy网络一个value网络,这两部分要么分开训两个网络,要么合到一起作为一个网络的两个头。分开的好处是policy和value互相不会影响,合到一起的好处是feature是共享的,训练的时候相互 ......
Gradient
Phasic
Policy
更新时间 2023-04-06
共1篇 :1/1页
首页
上一页
1
下一页
尾页