llamafile

by Mozilla · Windows, macOS, Linux, FreeBSD

Framework Dev Tools Open Source v0.10.3 · 02.06.2026 активный

Формат дистрибуции LLM от Mozilla: один исполняемый файл содержит и модель, и веб-сервер, и CLI. Работает на любой платформе без установки зависимостей — просто скачать и запустить. Основан на llama.cpp, поддерживает Llama, Mistral, Phi, Gemma и другие модели. Идеален для оффлайн-инференса и встраивания в продукты.

v0.10.3
02.06.2026 current
Добавлен 02.07.2026 · Обновлён 02.07.2026 · Dev Tools
Установка
# Скачать готовый llamafile (пример: Mistral 7B)
curl -LO https://huggingface.co/Mozilla/Mistral-7B-Instruct-v0.2-llamafile/resolve/main/mistral-7b-instruct-v0.2.Q4_0.llamafile
chmod +x mistral-7b-instruct-v0.2.Q4_0.llamafile
./mistral-7b-instruct-v0.2.Q4_0.llamafile
# Откроет браузер с чатом на localhost:8080
# Также доступен OpenAI-совместимый API
переведено ИИ

llamafile

[линейный рисунок головы ламы на фоне слегка приоткрытой папки с файлами]

Лицензия Статус ci На основе llama.cpp На основе whisper.cpp Discord Mozilla Builders

llamafile позволяет распространять и запускать большие языковые модели (LLM) с помощью одного файла.

llamafile — это проект Mozilla Builders (см. анонсирующий пост в блоге), теперь обновленный Mozilla.ai.

Наша цель — сделать открытые LLM значительно более доступными как для разработчиков, так и для конечных пользователей. Мы делаем это, объединяя llama.cpp и Cosmopolitan Libc в одну среду, которая сводит всю сложность работы с LLM к исполняемому файлу (называемому "llamafile"), запускаемому локально на большинстве операционных систем и архитектур процессоров без необходимости установки.

llamafile также включает whisperfile — одиночный инструмент для преобразования речи в текст, созданный на основе whisper.cpp и той же системы упаковки Cosmopolitan. Он поддерживает транскрибацию и перевод аудиофайлов на всех тех же платформах, не требуя установки.

Версия v0.10.*

Начиная с версии 0.10.0, llamafile использует новую систему сборки, чтобы наш код было проще поддерживать в актуальном состоянии с последними версиями llama.cpp. Это означает, что хотя они поддерживают более новые модели и функциональность, но в то же время они могут быть лишены некоторых функций, к которым вы привыкли использовать (см. эту документацию для общего описания того, что было сделано). Если вам больше нравится «классический опыт», вы всегда можете получить доступ к предыдущим версиям на странице наших релизов. Наши предварительно собранные llamafile всегда указывают, с какой версией сервера они были созданы (пример 0.9.*, пример 0.10.*), поэтому вы всегда будете знать, какую версию программного обеспечения вы скачиваете.

Мы хотим услышать ваш голос! Вы либо новый пользователь, либо давний фанат, пожалуйста, поделитесь тем, что вы находите самым ценным в llamafile, и тем, что сделало бы его более полезным для вас. Читайте больше в блоге и присоединяйтесь к обсуждению здесь.

Быстрый старт

Скачайте и запустите свой первый llamafile за считанные минуты:

# Скачать модель-пример (Qwen3.5 0.8B)
curl -LO https://huggingface.co/mozilla-ai/llamafile_0.10/resolve/main/Qwen3.5-0.8B-Q8_0.llamafile

# Сделать файл исполняемым (macOS/Linux/BSD)
chmod +x Qwen3.5-0.8B-Q8_0.llamafile

# Запустить его
./Qwen3.5-0.8B-Q8_0.llamafile

Мы выбрали эту модель, потому что она является самой маленькой, для которой мы создали llamafile, поэтому, скорее всего, она будет работать «из коробки». Если у вас мощное оборудование и/или GPU, смело выбирайте более крупные и выразительные модели, которые должны обеспечить более точные ответы.

Для пользователей Windows: Переименуйте файл, добавив расширение .exe, перед запуском.

Примечание — В Windows могут запускаться только исполняемые файлы размером до 4 ГБ, поэтому любой llamafile свыше 4 ГБ работать не будет. Скачайте бинарный файл llamafile и запустите его с любыми внешними весами/моделями (GGUF).

Документация

Полную документацию вы можете найти на docs.mozilla.ai/llamafile, или сразу перейти к одному из следующих разделов:

Лицензирование

Хотя проект llamafile лицензирован по лицензии Apache 2.0, наши изменения в llama.cpp и whisper.cpp лицензированы по MIT (как и сами проекты), чтобы оставаться совместимыми и пригодными для переноса в будущем, если это будет необходимо.

Логотип llamafile на этой странице был создан при помощи DALL·E 3.

График истории звёзд

Комментарии
Войдите, чтобы оставить комментарий