vLLM

by vLLM Project (UC Berkeley) · OpenAI API, HuggingFace models, множество GPU-бэкендов

Framework Dev Tools Open Source v0.26.0 · 27.07.2026 активный

Инференс-движок для больших языковых моделей с экстремальной пропускной способностью: ключевая технология — PagedAttention, управляющая памятью GPU как виртуальной памятью ОС, что позволяет обслуживать в разы больше одновременных запросов на том же железе. Индустриальный стандарт для продакшн-инференса LLM, используется огромным числом компаний.

v0.26.0
27.07.2026 current
Добавлен 27.07.2026 · Обновлён 27.07.2026 · Dev Tools
Установка
pip install vllm

vllm serve meta-llama/Llama-3.1-8B-Instruct
# Поднимает OpenAI-совместимый API на localhost:8000
переведено ИИ

vLLM

Лёгкая, быстрая и доступная обслуживающая среда LLM для каждого

| Документация | Блог | Статья | Twitter/X | Форум пользователей | Slack для разработчиков |

🔥 Мы создали сайт vLLM, чтобы помочь вам начать работу с vLLM. Посетите vllm.ai, чтобы узнать больше. Для участия в мероприятиях, пожалуйста, посетите vllm.ai/events.


О проекте

vLLM — это быстрая и простая в использовании библиотека для инференса и обслуживания LLM.

Изначально разработанная в Sky Computing Lab при Калифорнийском университете в Беркли, vLLM превратилась в один из самых активных проектов с открытым исходным кодом, созданный и поддерживаемый разнообразным сообществом из многих десятков академических институтов и компаний, объединяющим более 2000 участников.

vLLM быстрая благодаря:

  • Достижению наилучшей в отрасли пропускной способности при обслуживании
  • Эффективному управлению памятью для ключей и значений внимания с помощью PagedAttention
  • Непрерывной пакетной обработке входящих запросов, фрагментарному пре-заполнению, кэшированию префиксов
  • Быстрому и гибкому выполнению моделей с использованием фрагментных и полных CUDA/HIP-графов
  • Квантизации: FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, compressed-tensors, ModelOpt, TorchAO, и другим методам
  • Оптимизированным ядрам внимания, включая FlashAttention, FlashInfer, TRTLLM-GEN, FlashMLA и Triton
  • Оптимизированным ядрам GEMM/MoE для различных точностей с использованием CUTLASS, TRTLLM-GEN, CuTeDSL
  • Спекулятивному декодированию, включая n-граммное, суффиксное, EAGLE, DFlash
  • Автоматической генерации ядер и трансформации на уровне графов с помощью torch.compile
  • Раздельному пре-заполнению, декодированию и кодированию

vLLM гибкая и проста в использовании благодаря:

  • Бесшовной интеграции с популярными моделями из Hugging Face
  • Обслуживанию с высокой пропускной способностью с использованием различных алгоритмов декодирования, включая параллельную выборку, поиск по лучу и другие
  • Тензорному, конвейерному, данных, экспертов и контекстному параллелизму для распределённого инференса
  • Потоковому выводу результатов
  • Генерации структурированного вывода с использованием xgrammar или guidance
  • Парсерам для вызова инструментов и рассуждений
  • Серверу API, совместимому с OpenAI, а также поддержке API сообщений Anthropic и gRPC
  • Эффективной поддержке нескольких LoRA для плотных и MoE-слоёв
  • Поддержке GPU NVIDIA, GPU AMD, GPU Intel, а также CPU на архитектурах x86/ARM/PowerPC. Дополнительно, различные аппаратные плагины, такие как Google TPU, Intel Gaudi, IBM Spyre, Huawei Ascend, Rebellions NPU, Apple Silicon, MetaX GPU и другие.

vLLM бесшовно поддерживает более 200 архитектур моделей на Hugging Face, включая:

  • Текстовые модели-декодеры (например, Llama, Qwen, Gemma)
  • Модели-смеси экспертов (например, Mixtral, DeepSeek-V3, Qwen-MoE, GPT-OSS)
  • Гибридные модели внимания и пространства состояний (например, Mamba, Qwen3.5)
  • Мультимодальные модели (например, LLaVA, Qwen-VL, Pixtral)
  • Модели эмбеддингов и поиска (например, E5-Mistral, GTE, ColBERT)
  • Модели вознаграждений и классификации (например, Qwen-Math)

Полный список поддерживаемых моделей можно найти здесь.

Начало работы

Установите vLLM с помощью uv (рекомендуется) или pip:

uv pip install vllm

Или соберите из исходного кода для разработки.

Посетите нашу документацию, чтобы узнать больше.

Вклад в проект

Мы приветствуем и ценим любые вклады и сотрудничество. Пожалуйста, ознакомьтесь с разделом Вклад в vLLM, чтобы узнать, как начать участвовать.

Цитирование

Если вы используете vLLM в своих исследованиях, пожалуйста, процитируйте нашу статью:

@inproceedings{kwon2023efficient,
  title={Efficient Memory Management for Large Language Model Serving with PagedAttention},
  author={Woosuk Kwon and Zhuohan Li and Siyuan Zhuang and Ying Sheng and Lianmin Zheng and Cody Hao Yu and Joseph E. Gonzalez and Hao Zhang and Ion Stoica},
  booktitle={Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles},
  year={2023}
}

Свяжитесь с нами

  • Для технических вопросов и запросов на функциональность, пожалуйста, используйте Issues в GitHub
  • Для общения с другими пользователями, пожалуйста, используйте Форум vLLM
  • Для координации вкладов и разработки, пожалуйста, используйте Slack
  • Для раскрытия проблем безопасности, пожалуйста, используйте функцию Security Advisories в GitHub
  • Для сотрудничества и партнёрств, пожалуйста, свяжитесь с нами по адресу collaboration@vllm.ai

Медиакит

Комментарии
Войдите, чтобы оставить комментарий