On-Policy vs. Off-Policy Deep RL: PPO vs. SAC
A comparison of PPO and SAC on MuJoCo locomotion and robotic-manipulation tasks, covering sample efficiency, stability, hyperparameter sensitivity, and practical compute cost.
A comparison of PPO and SAC on MuJoCo locomotion and robotic-manipulation tasks, covering sample efficiency, stability, hyperparameter sensitivity, and practical compute cost.