1.4 RL# 1.4.0 RL基础 Actor-Critic Bellman方程 GAE MDP Model-free & Model-based On-policy & Off-policy Policy Gradient Reward设计 Value & Q & Advantage 1.4.1 Online RL A2C & A3C DDPG HIL-SERL PPO SAC TD3 1.4.2 VLA Post-training GRPO for VLA PPO for VLA RLinf-VLA