Your GPU sits idle generating tokens because decode is memory-bound. Why HBM bandwidth in TB/s, not peak FLOPs, decides your inference serving architecture.