我是 Yiwen Cai,北京邮电大学计算机技术专业硕士在读。我的研究兴趣集中在算法与硬件之间的那一层——GPU 算子优化与 LLM 训推优化。目前在腾讯混元 AI Infra 实习,做推理框架调度与高性能算子优化。
教育经历#
- 北京邮电大学 · 硕士(2026.09 – 2029.06)计算机技术(推免)
- 实验室:ParCIS 并行计算与智能系统实验室
- 导师:李士刚 教授
- 北京邮电大学 · 本科(2022.09 – 2026.06)计算机科学与技术
- GPA 3.76 / 4.0 · Rank 59/389 · CET6 552
实习经历#
- 腾讯混元 AI Infra(2026.07 – 至今)—— LLM 推理框架调度与高性能算子优化
- 覆盖 Blackwell 架构 attention / 量化 / 融合类算子,主要开源仓库 Tencent/hpc-ops
- 部分贡献已合入 vLLM main 分支
研究方向#
- LLM 训推优化
- GPU 算子优化(CUDA / Triton)
- 分布式计算与云计算、高性能计算
代表性工作#
- 华为 ICT 大赛全国总决赛一等奖(最高算子迁移优化奖)——64 进 8、决赛第 3;作为队伍唯一开发者获算子迁移优化赛题所有队伍最佳。
- cuda-gemm——从零手写 CUDA GEMM;SGEMM 达 cuBLAS 95.1%,HGEMM Tensor Core 达 213 TFLOPS。
- FastGNN——基于 Tensor Core 的 GNN 训练系统;相对 DGL/PyG 加速 1.8x–3.3x。
- 第十五届蓝桥杯北京赛区二等奖。
- 详见 项目 页。
简历#
联系#
- GitHub:@yiwen-cai
- 邮箱:caiyiwen.cs@foxmail.com