Создатель платформы T3 и популярный разработчик Тео Браун (Theo Browne) опубликовал видеообзор, в котором доказывает, что запуск высококачественных локальных моделей искусственного интеллекта остаётся экономически и технически неоправданным для большинства пользователей. Дискуссия развернулась в X (Twitter), где сторонники и противники тезиса привели контраргументы.
Тео Браун, основатель фреймворка T3 и автор образовательного контента для разработчиков, выступил с критикой идеи массового перехода на локальные ИИ-модели. В часовом видео, опубликованном 7 июля, он утверждает, что даже при наличии открытых весов (weights) крупных языковых моделей их развёртывание на собственных мощностях проигрывает облачным решениям по стоимости, производительности и удобству.
По словам Брауна, ключевые проблемы локальных моделей — высокая стоимость оборудования, низкая энергоэффективность и отсутствие параллелизма. Например, для запуска модели уровня Llama 3.1 405B требуется как минимум четыре видеокарты NVIDIA H100, что обходится в десятки тысяч долларов. При этом производительность такого решения будет уступать облачным API, где за те же деньги можно получить доступ к более мощным и оптимизированным моделям. «Вы платите за железо, электричество и обслуживание, но всё равно получаете худший результат», — отметил Браун в видео.
Сторонники локальных моделей парируют, что их преимущества — приватность данных, возможность работы без интернета и доступ к нецензурированным версиям моделей. Как написал в X разработчик Дастин Хайтауэр (Dustin Hightower), «даже небольшие локальные модели с поддержкой инструментов (tool calling) превосходят GPT-3.5, а для задач вроде суммаризации или генерации эмбеддингов они подходят идеально». Другой аргумент — возможность развёртывания моделей на недорогом оборудовании (например, за 200 долларов) для специфических задач, где не требуется высокая точность.
Однако критики тезиса Брауна указывают, что его аргументация слишком узка. Исследовательница Мерве Ноянн (Merve Noyann) в серии постов отметила, что Браун рассматривает локальные модели исключительно через призму кодинга и агентных систем, игнорируя сценарии корпоративного использования. «GLM или Qwen развёртывают не для того, чтобы заменить облачные API в разработке, а чтобы обеспечить конфиденциальность данных и параллельную работу нескольких пользователей в рамках одной команды», — пишет Ноянн. Она также привела данные своих экспериментов: на сервере с видеокартами NVIDIA DGX Spark модель Qwen 3.6 в 6-битной квантизации способна обрабатывать до 10 параллельных запросов без значительной потери качества.
Дискуссия высветила разрыв между идеализированным представлением о локальном ИИ и реальными ограничениями. Для индивидуальных пользователей и небольших команд облачные API остаются более практичным выбором, тогда как крупные компании и исследовательские лаборатории продолжают инвестировать в локальные решения ради контроля над данными и снижения долгосрочных затрат. При этом, как подчёркивают обе стороны, развитие технологий квантизации и оптимизации может изменить баланс в ближайшие 2–3 года.