DeepSeek обзавелся зрением: новая вкладка Vision меняет правила общения с нейросетью

Китайский разработчик DeepSeek добавил в свой чат-бот новую вкладку Vision. С ее помощью нейросеть теперь умеет обрабатывать не только текст, но и визуальный контент. Пользователям стала доступна загрузка изображений прямо в диалоговое окно.

DeepSeek запустил функцию Vision: чат-бот научился анализировать изображения

Фото: Крылатское.ру

Функция открывает доступ к анализу графиков, диаграмм и таблиц. Достаточно загрузить скриншот или фотографию документа, чтобы модель расшифровала данные, объяснила сложную визуализацию или структурировала информацию в читаемый текст.

Vision, в чем убедилась редакция Крылатское.ру, распознает текстовые фрагменты на любых изображениях. Пользователь может сфотографировать страницу книги, рецепт или визитную карточку, а чат-бот извлечет оттуда содержание. Иностранный текст на снимке также поддается переводу - функция работает с несколькими языками.

Режим может пригодиться и в учебе. Если загрузить фотографию задачи или математического примера, нейросеть распознает условие и предложит пошаговое решение. При этом технология ориентируется именно на визуальный контекст, а не просто на заранее известный ответ.

Vision стала третьей вкладкой в интерфейсе чата. Две другие - это «Текст», базовый режим для стандартных диалогов, и «Поиск», который позволяет искать информацию в интернете. Таким образом, компания продолжает превращать свой сервис в универсальный рабочий инструмент, закрывающий разные потребности пользователей в одном окне.

DeepSeek - это китайская компания, специализирующаяся на разработке больших языковых моделей и приложений на их основе. В отличие от многих конкурентов, она делает акцент на открытость технологий, предоставляя доступ к исходному коду и научным публикациям. Чат-бот DeepSeek известен способностью обрабатывать большие объемы данных и поддерживает загрузку файлов форматов PDF, Word, Excel и PowerPoint.

Первая полоса