MCP серверы, LSP, скиллы, плагины, AI-модели и другие инструменты
by Ollama
✔ Llama, DeepSeek, Qwen, Gemma и др. открытые модели
Запускает большие языковые модели локально одной командой — без ручной настройки окружения, драйверов и весов. Скачивает, квантует и обслуживает модели через простой CLI и OpenAI-совместимый …
by ggml-org / Georgi Gerganov
✔ GGUF-модели (Llama, Mistral, Qwen и др.), CPU/CUDA/Metal/Vulkan
Инференс LLM на чистом C/C++ без тяжёлых зависимостей — работает буквально везде: от смартфона и Raspberry Pi до серверных GPU-кластеров. Формат GGUF и квантование, которые …
by Mozilla
✔ Windows, macOS, Linux, FreeBSD
Формат дистрибуции LLM от Mozilla: один исполняемый файл содержит и модель, и веб-сервер, и CLI. Работает на любой платформе без установки зависимостей — просто скачать …
by vLLM Project (UC Berkeley)
✔ OpenAI API, HuggingFace models, множество GPU-бэкендов
Инференс-движок для больших языковых моделей с экстремальной пропускной способностью: ключевая технология — PagedAttention, управляющая памятью GPU как виртуальной памятью ОС, что позволяет обслуживать в разы …