AI Toolkit

MCP серверы, LSP, скиллы, плагины, AI-модели и другие инструменты

1 инструментов Сбросить

lm-evaluation-harness

v0.4.12
Tool Dev Tools Open Source

by EleutherAI (open source)

✔ Python, HuggingFace, OpenAI, любые LLM

Стандартный фреймворк для оценки и бенчмаркинга LLM. Используется исследователями для сравнения моделей — 400+ датасетов из коробки, единый интерфейс. Возможности: - 400+ встроенных задач: MMLU, …

# pip: pip install lm-eval # Запуск оценки (HuggingFace модель): lm_eval --model hf \ --model_args pretrained=mistralai/Mistral-7B-v0.1 \ --tasks mmlu,hellaswag \ --device cuda:0 \ --batch_size 8 # OpenAI: lm_eval --model openai-completions \ --model_args model=gpt-4o \ --tasks gsm8k # Результаты сохраняются в results.json