GenericAgent

by lsdefine (community) · Python, Linux, macOS, Windows, произвольная LLM с поддержкой function calling

Assistant AI Assistants Open Source v0.1.0 · 15.05.2026 активный

Минималистичный автономный AI-агент общего назначения: управляет браузером, файловой системой, ОС и мобильными устройствами через единый набор инструментов, без тяжёлого фреймворка вокруг. Способен сам дорабатывать собственный код по ходу выполнения задачи — редкий пример работающего самомодифицирующегося агента, а не просто концепции.

v0.1.0
15.05.2026 current

Установка
git clone https://github.com/lsdefine/GenericAgent.git
cd GenericAgent
pip install -r requirements.txt
python main.py
показать оригинал переведено ИИ

GenericAgent Banner

GenericAgent

Минимальный, саморазвивающийся автономный фреймворк агентов

~3K строк исходного кода · 9 атомарных инструментов · ~100-строчный цикл агента

Official Website Technical Report Reproduction Repo Tutorial Sophub

Trendshift

English · 中文

📌 Официальный: только GitHub + https://gaagent.ai. DintalClaw — единственный авторизованный коммерческий партнер; остальные не связаны.


🌟 Обзор

GenericAgent — это минимальный, саморазвивающийся фреймворк автономных агентов. Его ядро состоит всего из ~3K строк кода. С помощью 9 атомарных инструментов + ~100-строчного цикла агента он предоставляет любой модели большого языка системный контроль над локальным компьютером — включая браузер, терминал, файловую систему, ввод с клавиатуры/мыши, визуальное восприятие экрана и мобильные устройства (через ADB).

Философия дизайна — не загружать навыки заранее, а развивать их.

Каждый раз, когда GenericAgent решает новую задачу, он автоматически кристаллизует путь выполнения в переиспользуемый Навык. Чем дольше вы его используете, тем больше накапливается навыков — формируя личное дерево навыков, полностью выращенное из 3K строк исходного кода.

🤖 Доказательство само-загрузки — всё в этом репозитории, от установки Git и выполнения git init до каждого сообщения коммита, было выполнено автономно GenericAgent. Автор ни разу не открывал терминал.

📑 Содержание


📋 Ключевые особенности

Особенность Описание
🧬 Саморазвитие Автоматически кристаллизует каждую задачу в Навык. Возможности растут с каждым использованием, формируя личное дерево навыков.
🪶 Минимальная архитектура ~3K строк основного кода. Цикл агента — ~100 строк. Нет сложных зависимостей, нулевые накладные расходы на развёртывание.
⚡ Мощное выполнение TMWebdriver интегрируется в реальный браузер (сохраняя сессии входа). 9 атомарных инструментов берут прямой контроль над системой.
🔌 Высокая совместимость Поддерживает модели Claude / Gemini / Kimi / MiniMax и другие основные модели. Кроссплатформенность.
💰 Эффективное использование токенов <30K окно контекста — доля от 200K–1M, которые потребляют другие агенты. Меньше шума, меньше галлюцинаций, более высокий процент успеха, меньшие затраты.

🎯 Демонстрация

---
🛡️ Выживание в реальном браузере при CAPTCHA 🌐 Автономное исследование веб-страниц
Discord hCaptcha passed in real browserWeb Exploration
При настройке бота Discord во время выполнения задачи появляется капча hCaptcha с вопросом «Вы человек?» — реальная сессия браузера GA проходит её, и задача продолжается. Подробнее см. Реалистичность браузера инструментов GA. Автономно просматривает веб-контент и периодически подводит итоги.
🧋 Заказ еды 📈 Квантитативный скрининг акций
Order Tea Stock Selection
«Закажи мне молочный чай» — переходит по приложению доставки, выбирает товары, завершает оформление заказа. «Найди акции GEM с золотым крестом EXPMA, оборот > 5%» — квантитативный скрининг.
💰 Отслеживание расходов 💬 Групповое сообщение
Alipay Expense WeChat Batch
«Найди расходы свыше ¥2000 за последние 3 месяца» — управляет Alipay через ADB. Отправляет массовые сообщения в WeChat, полностью управляя клиентом WeChat.

🚀 Быстрый старт

⚠️ Версия Python: используйте Python 3.11 или 3.12. Не используйте Python 3.14 — он несовместим с pywebview и несколькими другими зависимостями GA.

📖 Подробное руководство по установке: installation.md · installation_zh.md(中文)

Для агентов LLM

Скачайте руководство по установке и следуйте ему:

curl -fsSL https://raw.githubusercontent.com/lsdefine/GenericAgent/refs/heads/main/docs/installation.md

Для людей

Метод 1 — Клонирование и установка (рекомендуется)

git clone https://github.com/lsdefine/GenericAgent.git && cd GenericAgent
uv venv && uv pip install -e ".[ui]"
cp mykey_template_en.py mykey.py   # fill in your LLM API key

Зависимости разделены на уровни: ядро агента требует только requests, плюс четыре лёгких пакета (beautifulsoup4, bottle, simple-websocket-server, aiohttp) для локального сервера TMWebdriver. Дополнение [ui] подтягивает библиотеки фронтенда (Streamlit, prompt_toolkit/rich для TUI, ...) — установите его для встроенных интерфейсов или пропустите его полностью и управляйте агентом без графического интерфейса. Не требуется Playwright, LangChain или бинарные файлы браузеров для скачивания.

Затем запустите:

python frontends/tui_v3.py   # Terminal UI (recommended)
python launch.pyw            # Streamlit web UI

Метод 2 — Установщик одной строкой (удобство)

Создаёт самодостаточную директорию с изолированной средой Python, Git и готовым к запуску пакетом. Скрипт находится в assets/ — если хотите, можете прочитать его сначала.

Windows PowerShell

powershell -ExecutionPolicy Bypass -c "$env:GLOBAL=1; irm https://raw.githubusercontent.com/lsdefine/GenericAgent/main/assets/ga_install.ps1 | iex"

Linux / macOS

GLOBAL=1 bash -c "$(curl -fsSL https://raw.githubusercontent.com/lsdefine/GenericAgent/main/assets/ga_install.sh)"

💡 GenericAgent расширяет свою среду через самого агента — не устанавливайте всё заранее. См. Разблокировка расширенных возможностей ниже.


💻 Использование

Фронтенды

Терминальный интерфейс (рекомендуется)

Лёгковесный терминальный интерфейс, ориентированный на прокрутку, построенный на основе prompt_toolkit + rich. Поддерживает несколько одновременных сессий и потоковую передачу данных в реальном времени.

python frontends/tui_v3.py

⚠️ Устранение неполадок TUI для Windows

Отрисовка TUI на Windows может быть нестабильной в зависимости от терминала и шрифта. Распространённые причины:

  1. prompt_toolkit / rich не обновлены до последней версии — сначала выполните pip install -U prompt_toolkit rich.
  2. PowerShell / cmd поставляются с терминалами, которые плохо поддерживают Unicode и комбинации клавиш. Предпочитайте Git Bash на Windows, который ведёт себя гораздо лучше.
  3. Если всё ещё выглядит сломанным, попросите GA исправить это:

    "Мой опыт использования frontends/tui_v3.py в PowerShell / cmd / Git Bash на Windows очень плохой — много несовместимостей. Ссылка на лучшие практики Claude Code для терминала Windows и исправление всех несовместимостей шрифтов и отрисовки."

Интерфейс Streamlit

python launch.pyw

Интерфейс бота (IM)

GenericAgent также поддерживает фронтенды IM, такие как Telegram, Discord и Lark.

Платформа Команда
Telegram python frontends/tgapp.py
Discord python frontends/dcapp.py
Lark / Feishu python frontends/fsapp.py

WeChat, QQ, WeCom и DingTalk также поддерживаются — см. китайский раздел ниже. Для детальной настройки обратитесь к самому GenericAgent.


🔓 Разблокировка расширенных возможностей

В GA расширенные возможности разблокируются инструкциями агенту, а не чтением документации или установкой дополнительных пакетов. Каждая инструкция ниже заставляет GA читать предварительно установленные СОПы (стандартные операционные процедуры).

(испытанные на поле боя инструкции в своей памяти), установите всё недостающее, адаптируйте под вашу ОС и сохраните результат в своей памяти.

Возможность Просто скажите GA
🌐 Автоматизация веб-браузера "Настройте вашу возможность автоматизации веб-браузера." — GA проведёт вас через единственный ручной шаг: перетаскивание встроенного расширения Chrome в chrome://extensions.
🔤 Распознавание текста (OCR) "Настройте вашу возможность распознавания текста с использованием rapidocr и сохраните её в памяти."
👁️ Видение "Настройте вашу возможность зрения по шаблону в памяти/." — GA копирует шаблон, подключает его к вашим существующим ключам LLM и проводит самотестирование.
🖱️ Работа с компьютером "Исследуйте эту систему и настройте вашу возможность работы с компьютером."

💡 О языке: предварительно установленные стандартные операционные процедуры (SOPs) написаны на китайском — GA читает их нативно, поэтому это никогда не станет для вас препятствием. Если вы предпочитаете базу знаний на английском, просто скажите: "Прочитайте ваши предварительно установленные SOPs и перепишите их на английском (сохраните код, пути и строки ошибок без изменений)."

🌍 О платформах: SOPs были отточены на Windows, но кросс-платформенная адаптация сама по себе является задачей GA — на macOS/Linux GA самостоятельно заменяет платформенные эквиваленты (перечисление окон, управление вводом, скриншоты). То же самое принцип самоэволюции.


🧠 Архитектура

GenericAgent выполняет сложные задачи через Слоистая Память × Минимальный Набор Инструментов × Автономный Цикл Выполнения, непрерывно накапливая опыт во время выполнения.

1️⃣ Система Слоистой Памяти

Память кристаллизуется в процессе выполнения задач, позволяя агенту строить устойчивые и эффективные рабочие паттерны со временем.

Слой Название Описание
L0 Метаправила Ядровые поведенческие правила и системные ограничения
L1 Индекс Инсайтов Минимальный индекс памяти для быстрого маршрутизирования и воспроизведения
L2 Глобальные Факты Устойчивые знания, накопленные в ходе длительной работы
L3 Навыки Задач / SOPs Восстанавливаемые рабочие процессы для выполнения конкретных типов задач
L4 Архив Сессий Архивированные записи задач, дистиллированные из завершённых сессий для долговременного воспроизведения

2️⃣ Автономный Цикл Выполнения

Восприятие состояния окружения → Рассуждение о задаче → Исполнение инструментов → Запись опыта в память → Цикл

Весь основной цикл — это всего ~100 строк кода (agent_loop.py).

3️⃣ Минимальный Набор Инструментов

GenericAgent предоставляет всего 9 атомарных инструментов, формирующих основные возможности взаимодействия с внешним миром.

Инструмент Функция
code_run Выполнение произвольного кода (Python / PowerShell)
file_read Чтение файлов
file_write Запись / создание / перезапись файлов
file_patch Исправление / модификация файлов
web_scan Восприятие контента веб-страниц
web_execute_js Управление поведением браузера
ask_user Подтверждение с участием человека
update_working_checkpoint (память) Краткосрочная рабочая заметка
start_long_term_update (память) Дистилляция долговременной памяти

4️⃣ Расширение Возможностей

Способен динамически создавать новые инструменты.

С помощью code_run, GenericAgent может динамически устанавливать пакеты Python, писать новые скрипты, вызывать внешние API или управлять аппаратным обеспечением в реальном времени — кристаллизуя временные способности в постоянные инструменты.

GenericAgent Workflow
Диаграмма рабочего процесса GenericAgent


🧬 Механизм Самоэволюции

Это то, что в корне отличает GenericAgent от всех других фреймворков агентов.

[New Task]
   │
   ▼
[Autonomous Exploration]   ─►  install deps · write scripts · debug · verify
   │
   ▼
[Crystallize into Skill]   ─►  write to memory layer
   │
   ▼
[Direct Recall on Next Similar Task]
Что вы говорите Первый раз Каждый раз после
"Прочитайте мои сообщения в WeChat" Установка зависимостей → обратная база данных → написание скрипта чтения → сохранение Навыка однострочный вызов
"Дайте мне утренний дайджест Hacker News" Написание скрейпера → сбор дайджеста → планирование ежедневного запуска → сохранение Навыка однострочный вызов
"Мониторьте акции и оповещайте меня" Установка mootdx → построение потока выбора → конфигурация cron → сохранение Навыка однострочный старт
"Отправьте этот файл через Gmail" Конфигурация OAuth → написание скрипта отправки → сохранение Навыка готов к использованию

Через несколько недель ваш экземпляр агента будет иметь дерево навыков, которого нет ни у кого в мире — всё выращенное из 3K строк исходного кода.


📊 Сравнение

Функция GenericAgent OpenClaw Claude Code
База кода ~3K строк ~530,000 строк Открытый исходный код (большой)
Развёртывание pip install + API-ключ Оркестровка мультисервисных компонентов CLI + подписка
Управление браузером Реальный браузер (сессия сохранена) Песочница / безголовый браузер Через плагин MCP
Управление ОС Мышь/клавиатура, зрение, ADB Делегирование мультиагентам Файлы + терминал
Самоэволюция Автономный рост навыков Экосистема плагинов Безсостоятельный между сессиями
Из коробки Несколько ядровых файлов + стартовые навыки Сотни модулей Богатый набор инструментов CLI
## 📈 Оценка

📂 Полные наборы данных и результаты оценки: JinyiHan99/GA-Technical-Report

Мы оцениваем GenericAgent по пяти измерениям:

# Измерение Вопрос Бенчмарки
1 Выполнение задач и эффективность токенов Может ли GA выполнять сложные задачи дешевле, чем ведущие агенты? SOP-Bench, Lifelong AgentBench, RealFin-Benchmark
2 Эффективность использования инструментов Может ли минимальный набор атомарных инструментов решать те же задачи, что и специализированные наборы, с меньшими накладными расходами? Benchmark эффективности инструментов (11 простых + 5 задач с длинным горизонтом)
3 Эффективность системы памяти Победит ли сжатая иерархическая память полную/избыточную память и ретриверы на основе эмбеддингов? SOP-Bench (опасные грузы), LoCoMo, стресс-тест на 20 навыков
4 Способность к самоэволюции Может ли агент дистиллировать опыт в переиспользуемые SOPs и код без вмешательства? 9-раундовое продольное исследование LangChain, кросс-задачный веб-бенчмарк из 8 задач
5 Способность к веб-серфингу Выживает ли проектирование на основе плотности в открытом вебе? WebCanvas, BrowseComp-ZH, пользовательские задачи (22)

Базовые модели по этим измерениям включают Claude Code, OpenAI CodeX и OpenClaw, оцененные на основе ядер Claude Sonnet 4.6, Claude Opus 4.6, GPT-5.4 и MiniMax M2.7.

Tool-use efficiency radar
Эффективность использования инструментов. GA доминирует по осям токенов, запросов и вызовов инструментов, сохраняя качество по четырём измерениям задач.
Cross-task self-evolution convergence
Кросс-задачная самоэволюция. Вторые и третьи запуски GA сходятся к стабильному режиму с низкими затратами по восьми веб-задачам, в то время как OpenClaw не показывает такой конвергенции.

Реалистичность браузера веб-инструментов GA (TMWebdriver)

Веб-инструменты GA работают на основе TMWebdriver — локального сервера WebSocket плюс расширения для Chrome — через реальную, постоянную сессию Chrome/Chromium, а не одноразовый headless-контейнер, сохраняя куки, состояние авторизации, расширения, поведение GPU/WebGL и обычные отпечатки браузерных сессий.

Служба обнаружения / Сигнал Обычная headless-автоматизация Веб-инструменты GA Примечания
Тест headless от SannySoft Часто обнаруживается ✅ 56/56 прошло bot.sannysoft.com
bot.incolumitas.com Часто терпит неудачу при проверках webdriver/CDP ✅ 36/36 прошло WEBDRIVER, SELENIUM_DRIVER, webDriverAdvanced — всё в порядке
Обнаружение ботов BrowserScan Часто аномальное ✅ Нормальное browserscan.net
Тест на обнаружение ботов Device & Browser Info Множество флагов ботов ✅ Человек / isBot=false deviceandbrowserinfo.com
Демонстрация обнаружения ботов FingerprintJS Часто обнаруживается ✅ Прошло Поток демо завершён без вердикта "бот"
Демонстрация reCAPTCHA v3 Низкий бот-подобный балл ✅ 0.9 человеко-подобный балл Риск-сигнал на основе баллов; 0.9 выше типичных производственных порогов

Для reCAPTCHA v3 значение 0.9 — это не "галочка решена"; это высокий балл, подтверждающий человеческое поведение, возвращаемый моделью риска, обычно достаточный для избежания дополнительных вызовов в производственных потоках.


📅 Дорожная карта и новости

  • 2026-05-23 — 🆕 Выпуск TUI v3 (frontends/tui_v3.py). Блочный скроллбек с корректной переразметкой при изменении размера, профиль цветов для каждого терминала для кросс-платформенной совместимости и функциональная совместимость с v2.
  • 2026-05-18 — 🆕 Режим Morphling. Впитывание навыков на уровне проекта — извлечение цели и тестов из любого внешнего репозитория, затем решение для каждого компонента: вызвать, переписать или отбросить. См. memory/morphling_sop.md.
  • 2026-05-17 — 🆕 Режим Goal Hive. Многопоточный кооперативный режим Goal — координируемые через BBS мастер/работники, выполняющие задачи с длинным горизонтом параллельно. См. memory/goal_hive_sop.md.
  • 2026-05-15 — 🖥️ Выпуск настольного GUI. Однострочные установки поставляют готовое настольное приложение (frontends/GenericAgent.exe). Разработчики запускают через python launch.pyw.
  • 2026-05-14 — 🆕 Оркестровка суб-агентов Conductor. Создание, супервизия и автоматическая очистка параллельных суб-агентов; примитивы делегирования первого класса дополняют /btw побочные вопросы.
  • 2026-05-12 — 🆕 Выпуск TUI v2 (frontends/tuiapp_v2.py). Улучшенный интерфейс Textual с поддержкой вставки изображений, вставки файлов, удаления блоков, копирования через Ctrl+C, навигации по истории и выбора /llm, /export, /continue.


⭐ Сообщество и поддержка

Если этот проект помог вам, пожалуйста, подумайте о том, чтобы оставить звезду! 🙏

🚩 Полезные ссылки

Благодарность сообществу LinuxDo за поддержку!

LinuxDo

Интерфейсы сообщества (независимые открытые проекты):

  • chilishark27/ga-manager
  • wangjc683/galley — Готовый локальный рабочий стол для агентов с встроенным GA-рантаймом (CPython 3.11 + зависимости), нативный GUI/CLI, мультисессии + оркестрация проектов, локально-ориентированный.
  • FroStorM/A3Agent
  • Fwind43/GenericAgent-Admin — Админ-панель на Go + React для рабочего стола: управление жизненным циклом сервиса, нативный чат, режим целей, доска BBS команды, редактор файлов, мастер настройки модели, мониторинг TMWebDriver, самообновление и интеграция с системным лотком/десктоп-петом Windows.

📄 Лицензия

Распространяется по лицензии MIT. Полный текст см. в файле LICENSE.

Отказ от ответственности: Официальные каналы GenericAgent — это данный репозиторий GitHub и https://gaagent.ai. DintalClaw является единственным официально уполномоченным коммерческим партнером; любые другие третьи стороны, организации или лица, использующие название GenericAgent, не являются официальными, если не указаны явно здесь.


🌟 Введение в проект

GenericAgent — это минималистичный, способный к самоэволюции, автономный фреймворк для агентов. В его основе всего ~3K строк кода, а с помощью 9 атомарных инструментов + ~100 строк цикла Agent Loop он наделяет любой LLM системным контролем над локальным компьютером, включая браузер, терминал, файловую систему, управление клавиатурой и мышью, экранное восприятие и мобильные устройства (ADB).

Философия дизайна — не предполагать наличие навыков, а получать их через эволюцию.

Каждый раз, решая новую задачу, GenericAgent автоматически фиксирует путь выполнения в виде Skill, который затем можно напрямую использовать. Чем дольше вы используете GenericAgent, тем больше накапливается навыков, формируя уникальное для вас дерево навыков, вырастающее из исходных 3K строк кода.

🤖 Доказательство самозапуска — всё в этом репозитории, начиная с установки Git, команды git init и заканчивая каждым сообщением коммита, выполнено GenericAgent самостоятельно. Автор ни разу не открывал терминал вручную.

📑 Содержание


📋 Основные возможности

Возможность Описание
🧬 Самоэволюция Каждая задача автоматически фиксируется как Skill, способности растут с использованием, формируя уникальное дерево навыков
🪶 Минималистичная архитектура ~3K строк основного кода, цикл Agent Loop около 100 строк, отсутствие сложных зависимостей, нулевая нагрузка на развертывание
⚡ Высокая исполнительная мощность Интеграция с реальным браузером (сохранение состояния сеанса), 9 атомарных инструментов для прямого контроля системы
🔌 Высокая совместимость Поддержка моделей Claude / Gemini / Kimi / MiniMax и других популярных, кроссплатформенное исполнение
💰 Экономия токенов Размер контекстного окна менее 30K, что в десятки раз меньше, чем у других агентов (200K–1M); меньше шума, меньше галлюцинаций, выше успешность, стоимость на порядок ниже

🎯 Примеры использования

🧋 Заказ еды на вынос 📈 Квантовый анализ акций
外卖下单 量化选股
"Закажите мне молочный чай" — автоматически переходит в приложение доставки еды, выбирает товар и завершает оплату "Найдите акции GEM с золотым крестом EXPMA, оборот > 5%" — фильтрация акций по квантовым условиям
🌐 Автономное исследование веб-страниц 💰 Отслеживание расходов
网页探索 支付宝支出
Автономное просмотр и периодическое резюмирование информации с веб-страниц "Найдите расходы более ¥2K за последние 3 месяца" — через ADB управление приложением Alipay
💬 Массовые сообщения
微信批量
Массовая отправка сообщений в WeChat, полный контроль над клиентом WeChat

🚀 Быстрый старт

> ⚠️ Версия Python: Рекомендуется использовать Python 3.11 или 3.12. Не используйте Python 3.14, так как он несовместим с pywebview и некоторыми зависимостями.

📖 Подробное руководство по установке: installation_zh.md (китайский) · installation.md (English)

Для LLM Agent

Скачайте и выполните инструкции по установке:

curl -fsSL https://raw.githubusercontent.com/lsdefine/GenericAgent/refs/heads/main/docs/installation_zh.md

Для пользователей

Метод 1 — Установка в один клик (рекомендуется)

Установка в один клик автоматически подготовит изолированную среду Python, Git, файлы проекта и настольное приложение, не загрязняя системную среду.

Windows PowerShell

powershell -ExecutionPolicy Bypass -c "irm http://fudankw.cn:9000/files/ga_install.ps1 | iex"

Linux / macOS

curl -fsSL http://fudankw.cn:9000/files/ga_install.sh | bash

После установки запустите:

  • Windows — Дважды кликните frontends/GenericAgent.exe
  • Linux / macOS — В директории установки выполните python launch.pyw

Метод 2 — Установка через Python (для разработчиков)

git clone https://github.com/lsdefine/GenericAgent.git
cd GenericAgent
uv venv
uv pip install -e ".[ui]"          # 核心 + UI 依赖
cp mykey_template.py mykey.py      # 填入你的 LLM API Key
python launch.pyw

💡 GenericAgent рекомендует автоматическое создание среды Agent в процессе использования, а не предварительную ручную установку всех зависимостей.

📖 Полный процесс запуска см. в docs/GETTING_STARTED.md 📖 Руководство для новичков (с иллюстрациями): Документация в Feishu 📘 Полный курс для начинающих (от Datawhale): Hello GenericAgent · GitHub


💻 Способы использования

Запуск интерфейса

Настольное приложение

Установка в один клик включает настольное приложение (Windows). Запустите двойным кликом:

frontends/GenericAgent.exe

Терминальный UI

Лёгкий интерфейс на основе Textual, поддерживающий многозадачность и потоковый вывод. Работает в любом терминале.

python frontends/tuiapp_v2.py

⚠️ Устранение проблем с отображением TUI на Windows

  1. Устаревшая версия textual — сначала выполните pip install -U textual;
  2. Встроенный терминал PowerShell / cmd плохо поддерживает Unicode и клавиатурные входы. На Windows рекомендуется использовать Git Bash — опыт будет стабильнее;
  3. Если проблемы сохраняются, дайте GA самостоятельно их исправить. Используйте следующий промпт:

    "При использовании frontends/tuiapp_v2.py в Windows (PowerShell / cmd / Git Bash) возникает множество несовместимостей. На основе конфигурации Claude Code для Windows-терминала исправьте все проблемы с шрифтами и отображением."

Streamlit UI

python launch.pyw

Интерфейс бота (мессенджеры)

GenericAgent поддерживает Telegram, Discord, WeChat, QQ, Feishu/Lark, Enterprise WeChat и DingTalk.

Платформа Команда запуска
Telegram python frontends/tgapp.py
Discord python frontends/dcapp.py
WeChat python frontends/wechatapp.py
QQ python frontends/qqapp.py
Feishu / Lark python frontends/fsapp.py
Enterprise WeChat python frontends/wecomapp.py
DingTalk python frontends/dingtalkapp.py

Подробные настройки уточняйте у GenericAgent.


🧠 Архитектура

GenericAgent выполняет сложные задачи через многоуровневую память × минимальный набор инструментов × цикл автономного выполнения, накапливая опыт в процессе.

1️⃣ Многоуровневая система памяти

Память формируется в процессе выполнения задач, позволяя Agent-у развивать стабильные и эффективные рабочие процессы.

Уровень Название Описание
L0 Метаправила (Meta Rules) Базовые правила поведения Agent и системные ограничения
L1 Индекс памяти (Insight Index) Упрощённый индекс для быстрого маршрутизирования и извлечения информации
L2 Глобальные факты (Global Facts) Стабильные знания, накопленные в процессе долговременной работы
L3 Навыки задач / SOPs Повторно используемые процессы для выполнения конкретных типов задач
L4 Архив сессий (Session Archive) Архивные записи из выполненных задач для долговременного извлечения

2️⃣ Цикл автономного выполнения

Восприятие состояния среды → логика задачи → вызов инструментов → запись опыта в память → цикл.

Весь цикл реализован в около 100 строк кода (agent_loop.py).

3️⃣ Минимальный набор инструментов

GenericAgent предоставляет всего 9 базовых инструментов для взаимодействия с внешним миром.

Инструмент Функция
code_run Выполнение произвольного кода (Python / PowerShell)
file_read Чтение файлов
file_write Запись / создание / перезапись файлов
file_patch Редактирование файлов
web_scan Сбор информации с веб-страниц
web_execute_js Управление поведением браузера
ask_user Взаимодействие с пользователем для подтверждения
update_working_checkpoint (Память) Краткосрочная рабочая доска заметок
start_long_term_update (Память) Формирование долговременной памяти

4️⃣ Механизм расширения возможностей

Поддержка динамического создания новых инструментов.

С помощью code_run, GenericAgent может в процессе выполнения устанавливать Python-пакеты, писать новые скрипты, вызывать внешние API или управлять аппаратным обеспечением, фиксируя временные возможности как постоянные инструменты.

GenericAgent 工作流程
Схема работы GenericAgent


🧬 Механизм самоэволюции

Это ключевое отличие GenericAgent от других фреймворков Agent.

[遇到新任务]
    │
    ▼
[自主摸索]   ─►  安装依赖 · 编写脚本 · 调试验证
    │
    ▼
[执行路径固化为 Skill]   ─►  写入记忆层
    │
    ▼
[下次同类任务直接调用]
Ваше высказывание Первое действие Последующие действия
"Мониторьте акции и напоминайте" Установка mootdx → построение процесса отбора → настройка таймера → сохранение Skill Запуск одной фразой
"Отправьте этот файл по Gmail" Настройка OAuth → написание скрипта отправки → сохранение Skill Готово к использованию

Через несколько недель ваш экземпляр Agent будет обладать уникальным набором навыков, выросшим из 3K строк исходного кода.


📊 Сравнение с аналогами

Характеристика GenericAgent OpenClaw Claude Code
Объём кода ~3K строк ~530K строк Открыт (большой объём)
Способ развёртывания pip install + API Key Оркестрация нескольких сервисов CLI + подписка
Управление браузером Интеграция с реальным браузером (сохранение сессий) Песочница / Headless-браузер Через MCP-плагин
Управление ОС Клавиатура/мышь, визуальное взаимодействие, ADB Множественные Agent-делегаты Файлы + терминал
Самоэволюция Автономное создание Skill и инструментов Экосистема плагинов Безсостоятельное между сессиями
Конфигурация из коробки Несколько ключевых файлов + минимальные начальные Skill Сотни модулей Богатый набор CLI-инструментов

📈 Тестирование

📂 Полный набор тестов и результаты см.: JinyiHan99/GA-Technical-Report

Мы оцениваем GenericAgent по пяти ключевым параметрам:

№ Параметр Основной вопрос Используемые бенчмарки
1 Степень выполнения задач и эффективность токенов Способен ли GA выполнять сложные задачи с меньшими затратами? SOP-Bench, Lifelong AgentBench, RealFin-Benchmark
2 Эффективность использования инструментов Может ли минимальный набор базовых инструментов заменить специализированные? Tool Efficiency Benchmark
3 Эффективность системы памяти Превосходит ли упрощённая многоуровневая память избыточную память и системы на основе Embedding? SOP-Bench, LoCoMo, тест на 20 навыков
4 Способность к самоэволюции Может ли Agent без вмешательства пользователя преобразовывать опыт в повторно используемые SOP и код? 9 циклов вертикального исследования LangChain, 8 кросс-задачных веб-бенчмарков
5 Способность работы с веб-страницами Способен ли дизайн, ориентированный на плотность информации, адаптироваться к открытым веб-страницам? WebCanvas, BrowseComp-ZH, пользовательские задачи
---

На представленных выше измерениях базовые показатели включают Claude Code, OpenAI CodeX и OpenClaw, протестированные на платформах Claude Sonnet 4.6, Claude Opus 4.6, GPT-5.4 и MiniMax M2.7.

工具使用效率雷达图
Радар эффективности использования инструментов. GA опережает конкурентов по параметрам токенов, количеству запросов и вызовов инструментов, сохраняя при этом качество на четырёх измерениях задач.
跨任务自我进化收敛曲线
Кросс-задачная самоэволюция. Во втором и третьем раундах выполнения на 8 веб-задачах GA сходится к стабильному диапазону низких затрат.

Реалистичность браузера в GA Web-инструментах

GA Web-инструменты работают в реальной, сохраняемой сессии Chrome/Chromium, а не в одноразовом headless-контейнере, что позволяет сохранять куки, сессии аутентификации, расширения, поведение GPU/WebGL и стандартные отпечатки браузерной сессии.

Проверочная служба / сигнал Обычная headless-автоматизация GA Web-инструмент Описание
Тест headless от SannySoft Часто распознаётся как бот ✅ 56/56 прошло bot.sannysoft.com
bot.incolumitas.com Часто выявляет аномалии в webdriver/CDP ✅ 36/36 прошло WEBDRIVER, SELENIUM_DRIVER, webDriverAdvanced — всё в порядке
Обнаружение ботов BrowserScan Часто показывает аномалии ✅ Нормальный browserscan.net
Тест на обнаружение ботов Device & Browser Info Множество бот-меток ✅ Человек / isBot=false deviceandbrowserinfo.com
Демонстрация обнаружения ботов FingerprintJS Часто распознаётся как бот ✅ Прошёл Процесс демо завершён, бот-определение не выдано
reCAPTCHA v3 demo Низкий балл / похоже на бота ✅ 0.9 — похоже на человека v3 основывается на балльной системе рисков; 0.9 выше типичных производственных порогов

Для reCAPTCHA v3 значение 0.9 — это не результат прохождения капчи, а высокий балл модели по подобию человеку, который обычно достаточен для преодоления стандартных порогов в производственной среде и избежания более строгих проверок.


📅 Дорожная карта и последние обновления

  • 2026-05-23 — 🆕 Официальный релиз TUI v3 (frontends/tui_v3.py). Блочная прокрутка с возможностью возврата + корректная переразметка при изменении размера, индивидуальная цветовая схема для каждого терминала для обеспечения кросс-платформенной совместимости, функциональная совместимость с v2.
  • 2026-05-18 — 🆕 Режим Morphling. Поглощение проектных возможностей — извлечение целей и тестов из произвольных внешних репозиториев, с последующим решением для каждого ключевого компонента: вызывать, переписывать или отбрасывать. Подробности в memory/morphling_sop.md.
  • 2026-05-17 — 🆕 Режим Goal Hive. Многопоточная версия Goal — Master/Worker синхронизируются через BBS для продвижения долговременных целей. Подробности в memory/goal_hive_sop.md.
  • 2026-05-15 — 🖥️ Релиз настольного GUI. Установка с одним кликом включает готовый к запуску настольный интерфейс (frontends/GenericAgent.exe), разработчики также могут запустить его через python launch.pyw.
  • 2026-05-14 — 🆕 Оркестровка подчиненных агентов Conductor. Распределение, мониторинг и автоматическая очистка параллельных подчиненных агентов; дополняет /btw обходной путь для агентов, предоставляя привилегированный примитив делегирования задач.
  • 2026-05-12 — 🆕 Официальный релиз TUI v2 (frontends/tuiapp_v2.py). Переработанный визуальный стиль на основе Textual: поддержка вставки и сворачивания изображений, вставки файлов, удаления блоков, копирования (Ctrl+C), навигации по истории, а также селекторов /llm, /export, /continue.
  • 2026-05-08 — 🆕 Режим Goal (reflect/goal_mode.py). Цикл самоуправления с бюджетированием времени — "оптимизировать X часов", не завершая раньше срока.
  • 2026-04-21 — 📄 Технический отчёт опубликован на arXiv — GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization.
  • 2026-04-11 — Внедрена архивация сессий L4, интеграция с планировщиком cron.
  • 2026-03-23 — Добавлена поддержка подключения личного аккаунта WeChat в качестве фронтенда бота.
  • 2026-03-10 — Опубликована библиотека из миллиона навыков.
  • 2026-03-08 — Опубликован "Политический краб" Dintal Claw на основе GenericAgent.
  • 2026-03-01 — Упоминание в Machine Heart.
  • 2026-01-16 — Опубликована публичная версия GenericAgent V1.0.

⭐ Сообщество и поддержка

Если этот проект вам помог, не забудьте поставить звёздочку! 🙏

Также приглашаем присоединиться к группе обмена опытом GenericAgent, чтобы обсуждать, давать обратную связь и совместно развивать проект 👏.

Группа в WeChat 23
微信群 23 二维码

🚩 Партнёрские ссылки

Благодарим за поддержку сообщество LinuxDo!

LinuxDo

Клиенты GUI для сообщества (независимые открытые проекты):

  • chilishark27/ga-manager
  • wangjc683/galley — готовое к использованию локальное рабочее пространство агентов с встроенным ядром GA (включает CPython 3.11 + зависимости), поддержка GUI/CLI, мультисессии + оркестровка проектов, приоритет локальной работы.
  • FroStorM/A3Agent
  • Fwind43/GenericAgent-Admin — панель управления на Go + React: управление жизненным циклом сервисов, нативный чат, режим Goal, доска BBS для команд, редактор файлов, мастер настройки моделей, мониторинг TMWebDriver, автообновление, а также интеграция с системным треем/десктопными виджетом на Windows.

📄 Лицензия

Распространяется под MIT License, подробности в LICENSE.

Заявление: Официальные каналы GenericAgent — это данный GitHub-репозиторий и https://gaagent.ai. DintalClaw — единственный официально лицензированный партнёр для коммерческого использования; любые другие сайты, организации или лица, использующие название GenericAgent без явного упоминания здесь, не являются официальными.

Войдите, чтобы оставить комментарий