
Если у вас есть интерес к ИИ и есть сложности с ВПН и оплатой зарубежных сервисов, то у меня для вас плохие новости.
Но есть и хорошие новости, которые заключаются в том, что open-source модели выпускаются оптимизированными для доступных устройств, например для процессоров M серии от Apple.
Как попробовать новинки, например muse-glimmer от Meta, которая как раз оптимизирована под работу с одной видеокартой или процессор Apple Silison — M5?
В своих тестах я использую 3 варианта:
1. Docker models — прямо из Docker Hub качаем модель. Добавляем новые credentials в n8n, где в качестве Base URL используем http://model-runner.docker.internal:12434. Используем ноду Ollama, где уже выбираем модель для выполнения.
2. Контейнер Ollama в Docker. В Ollama скачиваем нужную модель командой
ollama run muse-glimmer
Дальше также добавляем в n8n новые credentials c Base URL: http://host.docker.internal:11434. Также используем ноды Ollama, где выбираем установленные в контейнере модели.
3. Локально установленная Ollama. Также скачиваем модель командой
«`ollama run muse-glimmer «`
В n8n добавляем credentials c Base URL: http://127.0.0.1:11434. Также используем ноды Ollama.
Чтобы не путаться между 2 и 3 вариантом в конфигурации docker-compose стоит выбрать для Ollama другой порт — развести модели.
Также надо учитывать что будет не одна модель, а 3 копии модели и места на диске также будет занимать в трех местах. Управлять этим надо будет соответственно.
Пробовать можно разные модели, но если модель оптимизирована под процессор, то в разных вариантах быстродействие модели может быть разным.
Мою тестовую задачу модель, запущенная в контейнере, а именно muse-glimmer:30b-q4_K_M решала 42 минуты, а ту же задачу, модель muse-glimmer:latest (она же muse-glimmer:30v-mlx) запущенная в локальной Ollama решала уже 10 минут, то есть в 4 раза быстрее.
А вы как, пробуете локальные модели, или только по API работаете?