LLMs, CUDA, PyTorch compilers, and performance work — written up as I go.
From GPU architecture and PTX/SASS to warp-tiling and deep asynchronous tensor core pipelines