
IT之家 8 月 6 日消息,强化学习已成为大模型训练主流范式,推动模型技术向行业核心场景工程化落地。其中,训推一致至关重要,因推理与训练过程耦合,基础设施差异易放大不确定性。
华为计算官方 8 月 5 日宣布,昇腾基于 Ascend C 编程语言提供完整训推一致算子集,在 Qwen3-30B MoE 模型上的测试实现 Logdiff 为 0,并通过昇腾亲和的 FA 算子优化,在 Eager 模式下获得 20%-60% 性能收益,为开发者提供高效可靠的强化学习训练方案。
RL 后训练训推不一致最根本的原因,是底层计算时累加不保序。若要从上到下保证训练引擎与推理引擎每一次累加顺序一致,需要框架侧与算子侧同时发力。模型参数越大,问题会进一步放大:张量并行、专家并行等切分策略,以及集合通信路径,任一环节对不齐,都无法做到最终的 true-on-policy。算子还需要覆盖多种调用场景,在关键计算步骤上施加约束,同时把性能损失控制在可用范围内 —— 这是一项系统性工程挑战。
训推不一致,指的是 Rollout(推理)引擎与训练引擎之间的数值不一致性。即使两者使用完全相同的模型权重,对相同 Token 序列计算得到的对数概率(logprob)也可能存在细微差异;该差异通常用 logdiff 衡量。

昇腾基于 Ascend C 编程语言对训推链路中的关键算子做了系统性约束与对齐,核心思路是:让训练与推理在「该累加的地方」走同一套数值路径,主要涉及如下 4 个修改:

在此基础上,再配合 FA 下发与调度优化,使训推一致不再以显著性能回退为代价,从而在实测中同时拿到 logdiff=0 与端到端加速。
华为宣布相关基础设施已开源,还将上线“训推一致问题识别 Skill”,支持排查残余 logdiff、定位是算子路径问题还是框架实现差异。
配资之家门户IT之家附开源地址如下:https://github.com/verl-project/verl-ascend-recipe/tree/main/true_on_policy股票融资公司门户
元股证券:ygzq.hk
]article_adlist-->
声明:新浪网独家稿件,未经授权禁止转载。 -->

配资白名单平台开户 元股证券:ygzq.hk 近日,有网友发帖称,“西安至广州东的K731次火车硬座惊现上下铺”,事件引
2026-07-23
优配网入口 元股证券:ygzq.hk融资配资平台入口 证券日报网讯8月7日,天富能源在互动平台回答投资者提问时表示,20
2026-08-08
当地时间3月5日证券杠杆,中国驻阿联酋大使馆发布致在阿联酋滞留同胞的温馨提示。内容如下: 当前中东地区安全形势快速演变,
2026-07-23
配资之家门户 韩国KOSPI指数收盘大涨17.91%,创下历史最大单日涨幅。SK海力士封住涨停杠杆炒股公司入口,涨幅30
2026-07-31
郑州炒股配资 不到3个月,美军就给SpaceX下了81亿美元的订单,先是5月份给了一份价值65亿美元的合同,其中包括41
2026-07-30