依据个人经历页与 Google Scholar 更新

下载中文 PDF

AI SYSTEMS / ASCEND / HPC

谭邵杰

AI 系统 · 昇腾训练推理 · 高性能计算

谭邵杰

中国科学技术大学计算机科学与技术硕士,现任华为昇腾训练开发工程师。聚焦 Ascend NPU 上的大模型训练推理框架优化、多模态模型迁移、分布式并行、强化学习与量化加速,并具备计算机体系结构和多节点 CPU/GPU/NPU 优化背景。

Intern-S2 相对 H200 性能提升
Intern-S1 Pro 推理性能
3 papers HPCC · DATE · CCF Trans. HPC

教育经历

中国科学技术大学计算机科学与技术(计算机体系结构)· 硕士
中国科学技术大学计算机科学与技术 · 学士

工作与研究经历

华为 · 昇腾产品线训练开发部

AI 训练推理框架与异构加速优化工程师

  • 围绕 PyTorch / torch_npu 优化 NPU 训练链路,覆盖细粒度 CPU 绑核、算子 Lazy Init、训练参数寻优与 L2 Cache 利用。
  • 完成 OpenSoraPlan、DeepSeek-VL2、GLM-4.1V 等多模态模型的 Megatron / FSDP 适配,并参与 DeepSeek-R1、Qwen3 大 EP 推理与 Attention INT8 量化攻关。
  • 适配 UniVL、verl + Qwen2.5-VL 等多模态 RL 链路;适配 DanceGRPO,将生成模型 RL 分数由 0.4 提升至 0.8。
  • 通过 GMM 和后处理高效计算,使 Intern-S1 Pro 推理性能翻倍;通过 GDN Triton 算子和框架优化,使 Intern-S2 Preview(Qwen3.5-35B)SFT 由 0.12× 提升至 0.72× H200。
XTuner + vLLM 技术报告Qwen3.5 优化技术报告

华为 2012 实验室

暑期实习 · 存内计算 PIM 任务调度研究

  • 构建编译时性能模型,以局部性聚类和连接性聚类减少数据移动。
  • 结合并行度、访存端口压力等静态特征,在 PIM 与 CPU 间选择更优执行位置。
  • 仅依赖静态分析获得接近最优的调度结果,避免动态测量开销。

中国科学技术大学 × 华为

鲲鹏 920 基本块吞吐量建模

  • 开发基本块吞吐量预测框架,整理吞吐量、延迟与端口压力等指令描述信息。
  • 构建覆盖真实应用和评估工具的基准集,并开发运行环境获取准确吞吐量。
  • 结合鲲鹏 920 微架构改进 llvm-mca 在 AArch64 下的精度,成果发表于 HPCC 2022。

代表项目

Intern-S2 Preview SFT 优化

浦江实验室 · Qwen3.5-35B

  • 定位 GDN 模块占开箱耗时 70%+,消除 causal_conv1d / KKT 路径中的 transpose,并将关键低效 Triton 实现替换或优化为 Ascend C。
  • 为 GDN 扩展 chunk size 128,优化 solve-tril、KKT、RMSNormGated 与 CV 核同步;通过绑核、去除双机 SP2 通信、融合 RMSNorm 和 CANN 升级完成框架侧优化。
  • 算子与框架联合优化,使 Intern-S2 Preview(Qwen3.5-35B)SFT 从 0.12× 提升至 0.72× H200。
阅读 Qwen3.5 优化技术报告(PDF)

QuEST 多 GPU 量子门电路模拟

ASC20-21 世界大学生超级计算机竞赛

  • 使用 CUDA-aware MPI 直接访问 GPU 显存,并以多 stream 和 buffer 重叠计算与通信。
  • 用 cuBLAS 替代向量点积与规约操作,在 4 机 8 张 A100 上将规模从 30 拓展至 34 qubits。
  • 相较 CPU 系统节约 200+ GB 内存,获得决赛一等奖。

大数据串行应用的 CPU 多节点优化

IPCC 2022 ACM 中国-国际并行挑战赛

  • 结合循环展开、手动向量化、OpenMP 与 MPI,实现指令级、节点内和节点间并行。
  • 优化数据结构、带宽利用和通信量,并以混合精度与 PSRS 等并行算法优化热点。
  • 在 AMD EPYC 7452 平台实现双节点 10,000×、单节点最高 2,800,000× 加速。

技术能力

编程C、C++、Python、Shell
AI 框架PyTorch、torch_npu、Megatron、FSDP、verl、vLLM
大模型系统Ascend NPU 训练推理、多模态模型、RL 后训练、Expert Parallel、Triton、Ascend C、Attention INT8 量化
并行计算MPI、OpenMP、CUDA、cuBLAS、多节点 CPU/GPU/NPU 优化
体系结构Intel/ARM 指令集、AArch64、CPU 微架构、PIM、性能建模
性能分析汇编级分析、向量化、缓存与带宽优化、llvm-mca

竞赛获奖

中国科学技术大学优秀毕业生2024
ASC20-21 世界大学生超级计算机竞赛决赛一等奖
ISC21 国际大学生超级计算机竞赛决赛一等奖
IPCC 2022 ACM 中国-国际并行挑战赛全国三等奖 · 5/130+

发表论文

S. Tan, Q. Jiang, Z. Cao, X. Hao, J. Chen, H. An. Uncovering the Performance Bottleneck of Modern HPC Processor with Static Code Analyzer: A Case Study on Kunpeng 920 CCF Transactions on High Performance Computing 6(3), 2024

Q. Jiang, S. Tan, J. Chen, H. An. A³PIM: An Automated, Analytic and Accurate Processing-in-Memory Offloader DATE 2024

Q. Jiang, S. Tan, Z. Cao, X. Hao, J. Chen, H. An. Quantifying Throughput of Basic Blocks on ARM Microarchitectures by Static Code Analyzers: A Case Study on Kunpeng 920 IEEE HPCC 2022

AI 实践与工程自动化

积极拥抱 AI,以真实项目加速技术理解与自动化开发:梳理技术演进、持续跟踪项目进展、组织有状态 Agent Teams,并探索以性能建模自动化部分优化流程。

AIHisTrendFuture

已上线

以可追溯的时间图谱梳理 AI 技术历史、趋势与未来,用一手证据、推导链和置信度沉淀技术认知。

GitHub在线网站

DevTracking

实践中

将计划、进展、阻塞、需求与交付证据沉淀为可追踪工作流和可视化看板,持续形成项目上下文。

GitHub

IPD-Teams

实验中

借鉴 IPD 角色分工组织有状态的软件迭代 Agent Teams,探索多 Agent 协作、交接与质量闭环。

GitHub

AutoResearch

开发中

构建本地驱动的大模型训练与调试闭环,将实验记录、性能指标、设计取舍和复盘沉淀为可复用资产。

GitHub

ProgramModeling

开发中

围绕显存、性能、MFU 与并行策略构建可执行建模图,逐步连接配置推荐、Agent 验证与自动校准。

GitHub

职业愿景

以第一性原理洞察本质,以系统创新放大智能价值。