源码 · 实验 · 证据
围绕语言前端、多层 IR、后端代码生成与算子编译,记录公开源码分析、独立实验和最小复现。让结论能回到代码、环境与测试结果。
从具体问题开始
前端与语言行为
从 CUDA C++ 的语法、语义和主机/设备边界出发,对照诊断、生成的 IR 与运行结果理解差异。
IR、变换与计算映射
围绕 LLVM IR、MLIR Dialect、Pass 与降层过程构造小实验;观察语义、布局、调度和存储约束如何被表达与保留。
后端与代码生成
沿指令选择、调度和寄存器分配分析目标代码,将优化判断落实到正确性与性能证据。
设备端与工具链
用独立案例研究编译、链接、加载、运行时、诊断与调试之间的配合。
算子与框架适配
选取 CUDA C++、Triton 或 PyTorch 算子,结合 vLLM、SGLang 等公开实现,拆解接口、计算、执行图和通信依赖。
验证与性能分析
使用回归、差分和边界测试,记录数值误差、数据规模、布局与测量条件,区分可编译、可运行、结果正确和性能达标。
每次调查留下什么
问题与假设 → 环境与版本 → 源码与实验 → 结果与证据 → 局限与下一步。
实验记录
暂未发布实验记录。完成验证后,将在这里整理可复核的过程与结果。