
Фото до статті
Андрій Савчук
Автор новин
Китайська компанія DeepSeek презентувала експериментальну мультимодальну систему V4-Flash-Vision-Exp. Вона є візуальною версією V4-Flash і тепер функціонує не тільки з текстами, але й із зображеннями та знімками екрана.
Система націлена насамперед на ШІ-агентів, яким необхідно обробляти візуальну інформацію та виконувати завдання через інтерфейси, зазначає The Decoder.

DeepSeek заявляє, що додавання можливості «бачити» не погіршило текстових спроможностей V4-Flash. Модель зберегла можливості для міркування, взаємодії з агентами та глобальні знання, але набула здатності аналізувати фотографії, діаграми, документи та елементи інтерфейсів користувача.
Найбільшу увагу привертають результати порівняння з Claude Opus 4.8 від Anthropic. Згідно з власними тестами DeepSeek, V4-Flash-Vision-Exp суттєво випереджає попередню текстову версію в мультимодальних завданнях для агентів і в деяких тестах наближається до Claude Opus 4.8. Зокрема, модель DeepSeek показала результат 27,3 проти 25,7 балів Claude в Agents’ Last Exam, а в ZeroBench Pass@5 — 35 проти 34. Водночас в інших тестах перевага залишилася за Claude.

Слід зазначити, що ці результати поки що не слід сприймати як незалежне підтвердження переваги DeepSeek. Тестування проводила сама китайська компанія, а повноцінних сторонніх порівнянь нової експериментальної моделі наразі недостатньо.
Однією з ключових переваг V4-Flash-Vision-Exp може стати ціна. DeepSeek не підвищила розцінки порівняно зі звичайною V4-Flash. Кожне зображення обробляється максимум як 384 токени, що дозволяє суттєво зменшити витрати при роботі з великими обсягами візуальної інформації. За оцінками англомовних джерел, це робить модель однією з найдоступніших мультимодальних альтернатив для розробників.
Нова модель поки що має статус Experimental і доступна через API. DeepSeek не розкрила повну технічну інформацію про свою архітектуру, тому наразі невідомо, наскільки значними є внутрішні модифікації порівняно з V4-Flash.
Таким чином, DeepSeek намагається інтегрувати сильні сторони своєї недорогої V4-Flash у сферу мультимодальних ШІ-агентів. Якщо заявлені результати будуть підтверджені незалежними тестами, V4-Flash-Vision-Exp може стати значно доступнішою альтернативою провідним моделям, таким як Claude Opus 4.8, для завдань, що вимагають одночасної роботи з текстом, зображеннями та інтерфейсами.
Нагадаємо, нещодавно стало відомо, що DeepSeek розробляє власний інструмент для агентного кодування — прямого конкурента Claude Code та Codex.
Головна > Новини > DeepSeek випустила V4-Flash-Vision-Exp — дешеву мультимодальну модель, яка працює на рівні Claude Opus 4.8
