deepseek-v4-1-flash-552-1-2c2f23a4

DeepSeek V4.1 Flash: 552 млрд параметрів та підтримка 1 млн токенів

Компанія DeepSeek представила мультимодальну модель V4.1 Flash, розроблену для оптимізації роботи з довгим контекстом та зниження навантаження на обчислювальну інфраструктуру. Попри загальну кількість у 552 млрд параметрів, система використовує лише частину з них під час виконання запитів, застосовуючи оновлений механізм управління контекстом.

Масштабування та архітектура

Ключова особливість V4.1 Flash полягає у вибірковому використанні ресурсів завдяки архітектурі Mixture-of-Experts (MoE). Замість залучення всієї нейромережі, модель активує лише необхідні компоненти. При обробці вхідних даних Encoder задіює близько 8 млрд параметрів, а при генерації відповіді Decoder використовує приблизно 16 млрд. Такий підхід дозволяє ефективно працювати з великими документами, кодом та тривалими діалогами, мінімізуючи витрати на обробку контексту.

Робота з контекстом

Модель підтримує контекстне вікно до 1 млн токенів. Завдяки переробці KV-кешу, де глобальний обсяг пам’яті на токен становить близько 890 байт, V4.1 Flash потребує в чотири рази менше HBM-пам’яті та у вісім разів менше місця на SSD порівняно з V4 Flash. Це суттєво спрощує масштабування інфраструктури та знижує вартість експлуатації.

Доступність та умови використання

Модель доступна через API під ідентифікатором deepseek-flash. Підтримка попередніх версій V4 Flash та V4 Flash Vision Experimental припинена, а запити до них автоматично перенаправляються на нову модель. Основні умови впровадження:

  • З 14 вересня запити до deepseek-v4-pro тимчасово перенаправляються на V4.1 Flash за її тарифами до виходу V4.1 Pro.
  • У непікові години вартість API-викликів знижується вдвічі.
  • Ваги моделі доступні на Hugging Face за ліцензією MIT.
  • Забезпечено сумісність із бібліотеками Transformers, vLLM, SGLang та іншими інструментами.

Коментування закрито.