具身智能面经(二):强化学习为什么容易被问挂

在具身智能的面试中,除了最基本的算法原理,强化学习问题经常围绕数据、奖励设计、策略更新和闭环评测展开。把这些环节串起来,才能讲清楚一个后训练方案为什么有效。

下面的问题整理自我的实际面试经历,覆盖较多细节。强化学习这块一定要准备充分,如果有原理性的问题答不出来,很容易被挂。

 

SHEN LAN

01  训练范式、数据与后训练决策

 

  1. 请结合项目说明预训练、SFT 与 GRPO 各自的作用,以及从数据准备、轨迹采样、奖励计算、策略更新到评测的完整流程。

  2. 在什么情况下,模仿学习或 SFT 已经足够,什么情况下值得引入强化学习?如何判断进入 RL 阶段的时机,并评估 SFT 对后续训练的影响?

  3. 在线强化学习与离线强化学习在数据获取和策略训练方式上有什么区别?在自动驾驶或机器人后训练中,如何选择或结合使用?

  4. 强化学习与模仿学习分别需要什么样的数据?如何挖掘场景、划分数据,并确定两类训练数据的配比?

  5. 失败轨迹和低质量样本在后训练中有哪些用途?它们应如何参与数据迭代或策略训练?

  6. On-policy 与 Off-policy 的核心区别是什么?两者对历史数据的复用方式有何不同,这会怎样影响样本效率?

 

SHEN LAN

02  Reward 设计与优势归因

 

  1. 如何判断 reward 设计是否合理?当策略出现异常行为或训练效果不佳时,如何定位奖励项冲突,并验证修改是否有效?

  2. 只有到达目标或完成任务时才获得奖励,可能给探索和学习带来哪些困难?如何进行奖励塑形,并验证它是否有效?

  3. 累计奖励可能使较长轨迹获得更高得分,即使它的任务效率更低。如何识别并处理这种长度偏置?

  4. 如何由逐步 reward 构造回报和 advantage,并用于轨迹策略更新?当轨迹末端发生碰撞时,如何避免此前的局部高分掩盖这一失败?

  5. 在采用稀疏奖励的机器人任务中,如何定义并可靠检测任务成功,进而生成终止奖励?

  6. Reward Shaping 在什么情况下会改变原任务的最优策略?基于势函数的奖励塑形需要满足哪些条件,才能保持最优策略不变?

 

SHEN LAN

03  PPO/GRPO:策略优化与稳定性

 

  1. PPO与GRPO在优势估计和策略更新上有哪些关键区别?如何结合任务特点选择算法,KL约束在其中起什么作用?

  2. GRPO中,同组样本的reward全部相同时,组内相对advantage会怎样?如果这种情况频繁出现,会如何影响学习,应怎样排查和处理?

  3. GRPO 中新旧策略的概率比ratio如何计算?clip以后对更新的梯度有什么影响?

  4. 对于自回归轨迹,token的log probability如何用于策略更新,重要性采样起什么作用?

  5. PPO中的GAE如何估计advantage?它对估计的偏差、方差以及训练稳定性有什么影响?

 

SHEN LAN

04   Rollout、闭环仿真与评测

 

  1. 奖励由规则定义时,强化学习策略为何仍可能优于规则规划器?如何验证实际收益?

  2. 闭环rollout需要怎样的交互仿真环境?状态更新、策略推理、重规划和训练循环如何衔接?

  3. 为什么开环评测不足以反映实际表现?闭环评测如何揭示分布偏移和误差累积?

  4. 仿真训练的强化学习策略部署真机时,常见Sim-to-Real差异有哪些?如何定位主要性能损失?

  5. Domain Randomization为何有助于Sim-to-Real?哪些参数应随机化,范围如何设定?

 

SHEN LAN

05  SAC、DQN

 

  1. SAC的最大熵目标是什么?Actor与Critic如何更新?若写作最小化的loss,Q值项和熵项的符号如何确定?

  2. SAC的重参数化如何让梯度穿过随机动作采样?不用它时如何估计策略梯度?

  3. SAC为何使用双Critic并取较小Q值?如何缓解过估计?

  4. DQN如何学习Q值,Double DQN解决什么问题?为何由online网络选动作、target网络估值?

  5. DQN为什么要使用缓慢更新的target网络?每步同步会怎样?

  6. SAC与PPO的更新目标和采样方式有何不同?为什么SAC通常无需新旧策略概率比,而PPO 需要?

 

SHEN LAN

06  写在最后

 

回答强化学习问题时,既要讲清楚算法和训练过程,也要解释奖励是否符合任务目标、失败样本如何影响学习,以及训练收益如何在闭环中得到验证。

把算法原理、设计取舍和实验结果联系起来,回答会更有说服力。

 

文章来源:@bo233 知乎作者授权分享:https://zhuanlan.zhihu.com/p/2082240221471576304