Blogs

Optimizing MiniMax M3 Sparse Attention on NVIDIA Blackwell

Fireworks

Fireworks built a KV-stationary sparse-attention kernel for MiniMax M3 on NVIDIA Blackwell (SM100), reaching ~980 TFLOP/s: 1.9–2.4× a query-stationary baseline and ~1.6× open-source MSA.

Visit Site

Blogs Fireworks

BlogsUnlock Advanced Reasoning with NVIDIA Nemotron Nano 2 Models on FireworksFireworks BlogsMiniMax M3 is live: long context + native multimodality at 1/20th the priceFireworks BlogsOptimizing Retrieval Augmented Generation (RAG) with MongoDB Atlas and FireworksFireworks BlogsIntroducing Llama 3.1 inference endpoints in partnership with MetaFireworks BlogsDistillation with Reasoning: Can DeepSeek R1 Teach Better Than Humans?Fireworks BlogsHow Fireworks evaluates quantization precisely and interpretablyFireworks ResearchSnapKV: LLM Knows What You are Looking for Before GenerationCohere ResourcesOptimizing hard navigationsVercel BlogsOptimizing AI Application Development with Docker Desktop and NVIDIA AI WorkbenchDocker BlogsDocker Model Runner on the new NVIDIA DGX Spark: a new paradigm for developing AI locallyDocker ResourcesInstrumentationVercel BlogsPyTorch Foundation: The First Six MonthsLinuxfoundation ResearchMix Data or Merge Models? Optimizing for Diverse Multi-Task LearningCohere ResearchMultilingual Arbitrage: Optimizing Data Pools to Accelerate Multilingual ProgressCohere BlogsOptimizing AI Video Costs and SpeedHeygen BlogsWSL 2 GPU Support for Docker Desktop on NVIDIA GPUsDocker BlogsTop 10 Tips for Creating Attention-Grabbing AI Marketing VideosHeygen BlogsOptimizing aggregation in the Vitess query plannerPlanetscale BlogsIndexing sparse vectors with TursoTurso Products & ServicesMiniMax H3 Max: Free AI Video Generator, Ranked #1, Post-Trained by falFal