Венчурный инвестор Гарри Стеббингс (Harry Stebbings) сообщил, что основатели пяти неназванных стартапов заявили о снижении расходов на инференс моделей искусственного интеллекта на 75% без значительных инженерных усилий. Информация опубликована в его блоге на платформе Digg.
По словам Стеббингса, речь идёт о компаниях, работающих в области генеративного ИИ, которые оптимизировали затраты на выполнение запросов к моделям. Основатели утверждают, что достигли такого результата за счёт комбинации технических и организационных мер: пересмотра архитектуры инференса, использования более эффективных библиотек и переговоров с облачными провайдерами о тарифах.
Подробности методов не раскрываются, однако в публикации упоминается, что часть стартапов применила подходы, описанные в недавних исследованиях по оптимизации вычислительных нагрузок для ИИ. В частности, речь может идти о техниках квантизации моделей, динамическом батчинге запросов или переходе на специализированное «железо» для инференса.
Эксперт по ИИ и инвестор Рамез Наам (Ramez Naam) в комментарии к публикации отметил, что снижение стоимости инференса на 75% — «впечатляющий, но не невозможный» результат. «Если эти цифры подтвердятся, это может стать переломным моментом для экономики генеративного ИИ, особенно для стартапов с ограниченными бюджетами», — написал он.
Стеббингс не назвал конкретные компании, однако подчеркнул, что все они находятся на ранней стадии развития и используют модели с открытым исходным кодом или собственные разработки. По его словам, аналогичные меры могут быть применимы и к коммерческим API, таким как OpenAI или Anthropic, хотя в этом случае возможности оптимизации ограничены условиями лицензионных соглашений.
Источники: X-пост Гарри Стеббингса, 30 июня 2026 года; блог на платформе Digg.