←Back to NewsAI News/InfranewsInfraGpusMeta's TLX Beats FlashAttention-4 on Blackwell GPUs by 50%PyTorch's new Jagged Flash Attention kernel on Blackwell beats FlashAttention-4 by 13% forward and 50% backward using Triton Low-level Extensions.SourcePyTorchPublishedOct 1, 2026, 10:36 PMAuthorAlphaSignal NewsroomRead1 min readPyTorch's new Jagged Flash Attention kernel on Blackwell beats FlashAttention-4 by 13% forward and 50% backward using Triton Low-level Extensions.Reporting is indexed from AlphaSignal. Rights remain with the original publisher and cited sources.Read original report ↗Next readsGimlet Labs · newsGimlet Cloud Adds Cerebras to Hit 3,000 Tokens per Second for AI AgentsAlphaSignal · modelQwen3.8 Flash Next Runs a 125B Model on Dual V100s at 120 tok/sAlphaSignal · repoInco AI's Splash Runs Qwen3.8-27B Twice as Fast on Apple Silicon