Основные возможности
Запуск, остановка и перезапуск сервера с визуальным контролем статуса, анимацией загрузки и звуковыми оповещениями.
Прямое скачивание 9 различных сборок llama.cpp (Vulkan, CUDA, CPU и др.) прямо из меню. Автоматическая загрузка необходимых DLL.
Тонкая конфигурация: контекст, GPU-слои, Flash Attention, размеры batch, параметры генерации, настройки MoE и эмбеддингов.
Релизы и загрузки
Выберите необходимую версию или формат для вашей операционной системы
- Полная английская локализация интерфейса и расширенная поддержка языков.
- Добавлен параметр кастомного ввода команд при запуске
llama-server. - Поддержка алиасов моделей и дополнительных флагов генерации.
- Исправления ошибок стабильности процессов при частой перезагрузке сервера.
Улучшена работа встроенного загрузчика сборок llama.cpp (CUDA / Vulkan / CPU), добавлена расширенная валидация аргументов CLI.
Продуманный интерфейс
Главное окно разделено на три функциональные зоны для максимальной продуктивности:
- Панель путей: Быстрый выбор исполняемого файла, GGUF-модели и кнопка мгновенной загрузки бэкенда.
- Двухпанельный менеджер параметров: Слева удобный список категорий, справа — аккуратная сетка со всеми полями ввода.
- Окно логов: Интерактивный вывод потоков сервера с возможностью очистки, сохранения в файл или копирования в буфер.
Как это работает?
Скачайте бэкенд через Файл → Установить llama.cpp или укажите путь к своему файлу.
Выберите вашу любимую ИИ-модель в формате .gguf через файловый диалог.
Отрегулируйте параметры (например, количество GPU-слоёв для ускорения) под ваше железо.
Нажмите Запустить. Веб-интерфейс автоматически откроется на порту 18080!
Системные требования
- ✔ Windows: Полная поддержка (включая встроенный установщик бэкендов).
- ✔ Linux: Поддержка запуска сервера, сборка пакетов `.deb`, `.rpm` и архивов `.tar.gz`.
- ✔ Python: Версии 3.x для сборки из исходного кода.
Поддерживаемое железо (Бэкенды)
Приложение поддерживает любые графические и центральные процессоры благодаря глубокой интеграции с экосистемой: