面向 Claude Code / Codex 的 GPU kernel 开发 skill 集合,按 CUDA / Triton / NPU 分目录组织。已实装 CUTLASS/CuTe 环境配置(依赖检测、编译模板、VSCode IntelliSense、故障排查)与算子精度对拍(数值对拍 SOP、多 dtype 容差查表、TF32 污染规避),适配 sm_120(Blackwell)。
H100 上基于 TensorCore 的图神经网络训练系统,自研稀疏算子后端(Voltrix block-sparse SpMM、Fused3S 稀疏注意力、Rabbit 节点重排),相对 DGL/PyG 1.8–3.3× 加速。
基于 xllm 推理引擎适配 Qwen3.5,实现 GDN 线性注意力与 MTP 投机采样,解决 KV cache 异常,跑通 32k 输入推理。
用 Triton 融合 Add 与 RMSNorm,多行 program 映射 + hidden_size 分档调度,相比 PyTorch 基线 19.28× 加速。
从零手写 8 个 CUDA GEMM kernel,覆盖 FP32 CUDA Core 与 FP16 Tensor Core WMMA;SGEMM v3 达 cuBLAS 的 95.1%,HGEMM v3 达 213 TFLOPS。