by vLLM Project (UC Berkeley) OpenAI API, HuggingFace models, множество GPU-бэкендов
Инференс-движок для больших языковых моделей с экстремальной пропускной способностью: ключевая технология — PagedAttention, управляющая памятью GPU как виртуальной памятью ОС, что позволяет обслуживать в разы больше одновременных запросов на том же железе. Индустриальный стандарт для продакшн-инференса LLM, используется огромным числом компаний.
pip install vllm vllm serve meta-llama/Llama-3.1-8B-Instruct # Поднимает OpenAI-совместимый API на localhost:8000
| Документация | Блог | Статья | Twitter/X | Форум пользователей | Slack для разработчиков |
🔥 Мы создали сайт vLLM, чтобы помочь вам начать работу с vLLM. Посетите vllm.ai, чтобы узнать больше. Для участия в мероприятиях, пожалуйста, посетите vllm.ai/events.
vLLM — это быстрая и простая в использовании библиотека для инференса и обслуживания LLM.
Изначально разработанная в Sky Computing Lab при Калифорнийском университете в Беркли, vLLM превратилась в один из самых активных проектов с открытым исходным кодом, созданный и поддерживаемый разнообразным сообществом из многих десятков академических институтов и компаний, объединяющим более 2000 участников.
vLLM быстрая благодаря:
torch.compilevLLM гибкая и проста в использовании благодаря:
vLLM бесшовно поддерживает более 200 архитектур моделей на Hugging Face, включая:
Полный список поддерживаемых моделей можно найти здесь.
Установите vLLM с помощью uv (рекомендуется) или pip:
uv pip install vllm
Или соберите из исходного кода для разработки.
Посетите нашу документацию, чтобы узнать больше.
Мы приветствуем и ценим любые вклады и сотрудничество. Пожалуйста, ознакомьтесь с разделом Вклад в vLLM, чтобы узнать, как начать участвовать.
Если вы используете vLLM в своих исследованиях, пожалуйста, процитируйте нашу статью:
@inproceedings{kwon2023efficient,
title={Efficient Memory Management for Large Language Model Serving with PagedAttention},
author={Woosuk Kwon and Zhuohan Li and Siyuan Zhuang and Ying Sheng and Lianmin Zheng and Cody Hao Yu and Joseph E. Gonzalez and Hao Zhang and Ion Stoica},
booktitle={Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles},
year={2023}
}