华为 · 昇腾产品线训练开发部
AI 训练推理框架与异构加速优化工程师
- 围绕 PyTorch / torch_npu 优化 NPU 训练链路,覆盖细粒度 CPU 绑核、算子 Lazy Init、训练参数寻优与 L2 Cache 利用。
- 完成 OpenSoraPlan、DeepSeek-VL2、GLM-4.1V 等多模态模型的 Megatron / FSDP 适配,并参与 DeepSeek-R1、Qwen3 大 EP 推理与 Attention INT8 量化攻关。
- 适配 UniVL、verl + Qwen2.5-VL 等多模态 RL 链路;适配 DanceGRPO,将生成模型 RL 分数由 0.4 提升至 0.8。
- 通过 GMM 和后处理高效计算,使 Intern-S1 Pro 推理性能翻倍;通过 GDN Triton 算子和框架优化,使 Intern-S2 Preview(Qwen3.5-35B)SFT 由 0.12× 提升至 0.72× H200。
