Компании переплачивают за нейросети в разы, потому что не следят за одной китайской лабораторией. DeepSeek выложил открытую модель V4.1 Flash, и она стабильно обходит собственную старшую версию 4.0 Pro, которая стоит примерно вчетверо дороже. Мы разобрали это в выпуске на нашем канале: смотреть разбор на YouTube. Ниже главное текстом и три решения, которые предпринимателю стоит принять уже сейчас.
Разбор сделан по свежему выпуску канала Two Minute Papers, его ведёт исследователь Карой Жолнаи-Фехер. Он сам запускает модели и читает научные статьи, а не пересказывает пресс-релизы, поэтому, на наш взгляд, ему можно верить.
Что случилось
DeepSeek опубликовал новую модель и, что важнее, статью о том, как она устроена. Скачать и прочитать может любой, бесплатно.
Первое, что бросается в глаза, это скорость: ответы появляются почти мгновенно. Второе: на части тестов модель сравнима с Claude Opus 5 и Kimi K3, хотя далеко не на всех. А вот свою старшую версию, DeepSeek 4.0 Pro, она обходит стабильно, и это главный сюрприз.
Разница видна и по железу. Чтобы держать старшую модель у себя, нужен сервер примерно на 300 тысяч долларов. Новая обходится примерно в четверть этой суммы, около 75 тысяч. Всё ещё дорого, но автор уверен: при такой тенденции через год подобное будет работать в кармане.
Модель ещё и видит. Ей показали картинку меню старой игры, и она написала игру, которая это меню повторяет.
Что делать: перед покупкой дорогого решения проверить, не закрывает ли задачу открытая модель.
Как её ужали: главный фокус в памяти

Пока модель отвечает, она держит весь ваш разговор в рабочей памяти, как блокнот на переговорах. Этот блокнот живёт в видеопамяти, а это самая дорогая часть сервера. Именно память делает ИИ дорогим.
У новой модели этот блокнот в 437 раз меньше, чем у первой версии три года назад. И вчетверо меньше, чем у предыдущей Flash, которая вышла всего несколько месяцев назад.
Как это сделали. Представьте компанию из десятков отделов, где каждый отдел ведёт свой протокол одной и той же встречи. Нейросеть устроена похоже: она состоит из слоёв, и раньше каждый слой хранил свою копию разговора. В новой модели слои получили общий протокол: один блок его пишет, остальные читают оттуда нужное. Сделать это сложно, потому что разным слоям нужны разные детали одной истории, но у DeepSeek получилось.

Меньше памяти значит меньше видеокарт на один запрос. Меньше видеокарт значит дешевле сервер и дешевле цена для вас.
Что делать: спросить у поставщика ИИ, на какой модели он работает и сколько стоит один запрос.
Что это даёт бизнесу
Каждый раз, когда DeepSeek публикует новую статью, ИИ дешевеет для всех. Дешевеет не только сам DeepSeek: конкурентам приходится снижать цены следом. На наш взгляд, это главный эффект новости.
Дальше три практических следствия.
1. Своё железо или оплата по запросам. Если у компании есть сервер, открытая модель работает без абонентской платы. Если сервера нет, вы платите только за запросы.
2. Документы остаются у вас. Для российских компаний открытая модель это ещё и способ держать договоры и переписку внутри контура, а не отправлять за рубеж. Мы так и строим корпоративные контуры: подробнее на странице про внедрение искусственного интеллекта.
3. Скриншот вместо технического задания. Модель видит картинки, поэтому фото прайса, скриншот отчёта или фотография бумажной накладной превращаются в задачу: показали, модель сделала.
Что делать: запустить пилот на одной задаче и сравнить открытую модель с той, за которую вы платите сейчас.
Подвох, о котором не пишут в заголовках
Теперь честно про слабые места. Автор попросил три модели воспроизвести научную статью про сложную физику, похожую на пчелиные соты. GPT-6 Astra справился блестяще, Claude Opus 5 сделал физику достойно, а DeepSeek пока до них не дотянул. Сам автор уверен, что через пару таких статей DeepSeek догонит, и мы склонны с ним согласиться.
И главный подвох. Модель очень любит думать: прежде чем ответить, она долго рассуждает и сжигает огромное количество токенов. Токены это слова, за которые вы платите поставщику, включая слова, которые модель говорит сама себе. Каждое слово дешёвое, но слов очень много, и в итоге дешёвая модель может выйти дороже на конкретной задаче.
Что делать: сравнивать не цену за миллион токенов, а цену за решённую задачу.
Три решения для предпринимателя
1. Не подписывайте годовые контракты на ИИ. Цены здесь падают каждые несколько месяцев, а модель, которая сегодня кажется лучшей, через квартал станет дорогой.
2. Запустите пилот на одной задаче. Возьмите процесс, который уже считается в часах и деньгах, и сравните открытую модель с платной на одних и тех же данных.
3. Считайте цену за задачу, а не за токен. Дешёвый прайс и дорогой результат легко живут вместе.
Общий вывод: рынок ИИ дешевеет рывками, поэтому раз в квартал стоит пересматривать, на какой модели вы работаете.
Если хотите разобраться, как передавать нейросети свои документы и не платить лишнего, в бесплатной Академии Solaris это разбирают на примерах из бизнеса, а не на инженерном языке.
Сам выпуск, как и остальные на канале, целиком собрал наш ИИ-агент: нашёл тему, написал сценарий, озвучил, смонтировал и загрузил. Как это устроено, можно посмотреть на странице ИИ-агента для YouTube.
Частые вопросы
Что такое DeepSeek V4.1 Flash?
Открытая языковая модель китайской лаборатории DeepSeek. Её можно скачать и запустить на своём сервере, а описание устройства опубликовано статьёй. Внутри больше 500 миллиардов параметров, то есть настроек, которые модель выучила.
Почему память делает ИИ дорогим?
Пока модель отвечает, она держит весь диалог в рабочей памяти видеокарты. Чем больше этот объём, тем больше видеокарт нужно на один запрос и тем дороже обходится ответ.
Что значит «память ужали в 437 раз»?
Раньше каждый слой модели хранил свою копию разговора. Теперь слои пользуются общей записью: один блок её ведёт, остальные читают нужное. По сравнению с первой версией DeepSeek объём рабочей памяти уменьшился в 437 раз, по сравнению с предыдущей Flash в четыре раза.
Открытая модель дешевле платной?
По прайсу почти всегда да, по итогу не обязательно. Модель много рассуждает и тратит токены на собственные размышления, поэтому сравнивать надо стоимость решённой задачи, а не цену за миллион токенов.
Можно ли держать такую модель у себя в компании?
Да, если есть сервер. Для старшей версии нужно железо примерно на 300 тысяч долларов, для новой около 75 тысяч. Если своего сервера нет, доступ арендуется по запросам.
