On-Policy vs. Off-Policy Deep RL: PPO vs. SAC

A comparison of PPO and SAC on MuJoCo locomotion and robotic-manipulation tasks, covering sample efficiency, stability, hyperparameter sensitivity, and practical compute cost.