跳过正文

项目

2026

kernel-skills

面向 Claude Code / Codex 的 GPU kernel 开发 skill 集合,按 CUDA / Triton / NPU 分目录组织。已实装 CUTLASS/CuTe 环境配置(依赖检测、编译模板、VSCode IntelliSense、故障排查)与算子精度对拍(数值对拍 SOP、多 dtype 容差查表、TF32 污染规避),适配 sm_120(Blackwell)。

FastGNN:TensorCore GNN 训练系统

H100 上基于 TensorCore 的图神经网络训练系统,自研稀疏算子后端(Voltrix block-sparse SpMM、Fused3S 稀疏注意力、Rabbit 节点重排),相对 DGL/PyG 1.8–3.3× 加速。

2025

CUDA GEMM Kernels

从零手写 8 个 CUDA GEMM kernel,覆盖 FP32 CUDA Core 与 FP16 Tensor Core WMMA;SGEMM v3 达 cuBLAS 的 95.1%,HGEMM v3 达 213 TFLOPS。