vLLM

A high-throughput and memory-efficient inference and serving engine for LLMs

1.9× faster than LLM Infrastructure this week

7d +0.83% +741 stars in 7d
30d Not tracked yet — first tracked 2026-08-14
90d Not tracked yet — first tracked 2026-08-14

89,026 → 90,230 stars since Aug 14

amdblackwellcudadeepseekdeepseek-v3gptgpt-ossinferencekimillamallmllm-servingmodel-servingmoeopenaipytorchqwenqwen3tputransformer