iLenta Меню

Google представила ИИ-модель Gemini 2.5 Computer Use

09 октября 2025, 14:08 | Roter [755]
Google представила новую ИИ-модель под названием Gemini 2.5 Computer Use, которая позволяет агентам взаимодействовать с веб-сайтами и пользовательскими интерфейсами так же, как это делает человек.
Google представила ИИ-модель Gemini 2.5 Computer Use

Модель уже доступна в публичной предварительной версии через Gemini API в Google AI Studio и Vertex AI. Gemini 2.5 Computer Use основана на возможностях визуального восприятия и логического анализа модели Gemini 2.5 Pro. Она способна выполнять широкий спектр действий в браузере — нажимать кнопки, вводить текст, прокручивать страницы, наводить курсор, открывать выпадающие меню и переходить по ссылкам.

По словам Google, новая модель превосходит конкурирующие решения в тестах Online-Mind2Web, WebVoyager и AndroidWorld, при этом обеспечивая меньшую задержку отклика.

В отличие от традиционных ИИ-моделей, которые работают через API, Gemini 2.5 Computer Use анализирует скриншоты веб-интерфейсов и на их основе генерирует конкретные действия в пользовательском интерфейсе. Агент получает задачу в виде текстового запроса, снимок экрана и историю последних действий. После анализа интерфейса он выбирает подходящее действие — например, клик по кнопке или ввод текста в поле. Действие выполняется на стороне клиента, затем создаётся новый скриншот, и процесс продолжается циклически.

На демонстрации Google показала, как агент сортирует стикеры на цифровой доске и переносит данные о питомцах с одного сайта в CRM-систему. Видеопримеры были ускорены, чтобы показать процесс в реальном времени.

На данный момент модель поддерживает 13 типов действий и оптимизирована для работы в браузере. Поддержка задач на уровне настольных операционных систем пока не реализована, однако модель уже показывает хорошие результаты на мобильных тестах.

Для предотвращения злоупотреблений Google внедрила многоуровневую систему безопасности: каждое действие, предложенное моделью, проходит проверку службой безопасности перед выполнением. Разработчики могут ограничивать определённые действия или запрашивать подтверждение пользователя для операций повышенного риска, например финансовых транзакций.

Несколько внутренних команд Google уже используют модель в реальных проектах — для тестирования интерфейсов и автоматизации рабочих процессов в таких продуктах, как Search и Firebase. Внешние разработчики, получившие ранний доступ, применяют Gemini 2.5 Computer Use для создания инструментов автоматизации рабочих процессов и интеллектуальных помощников.

Источник: gizmochina

© 2012-2026 iLenta. Все права защищены.
Полная версия

AI

В macOS 27 обнаружили скрытый интерфейс Siri AI: Apple готовит более удобную работу с текстом
В macOS 27 обнаружили скрытый интерфейс Siri AI: Apple готовит более удобную работу с текстом
20 июля 2026, 23:07 | Bazelas
В тестовой версии macOS 27 Golden Gate пользователи обнаружили новую функцию Siri, которая пока скрыта от большинства участников программы бета-тестирования. Судя по всему, Apple экспериментирует с компактным всплывающим интерфейсом, позволяющим выполнять действия с выделенным текстом буквально в один клик.
Подробнее...
 
Nubia представила необычного ИИ-питомца iMoochi: робот умеет распознавать эмоции и становится «привязанным» к владельцу
Nubia представила необычного ИИ-питомца iMoochi: робот умеет распознавать эмоции и становится «привязанным» к владельцу
19 июля 2026, 15:07 | Bazelas

Компания Nubia официально представила в Китае нового робота-компаньона iMoochi, который заметно отличается от привычных умных колонок и голосовых помощников. Новинка делает ставку не на выполнение команд, а на эмоциональное взаимодействие с человеком. Устройство оснащено искусственным интеллектом, способным анализировать настроение собеседника, запоминать владельца и постепенно формировать индивидуальную модель общения.

Подробнее...
 
1Password получил интеграцию с Claude: ИИ теперь может входить на сайты без доступа к вашим паролям
1Password получил интеграцию с Claude: ИИ теперь может входить на сайты без доступа к вашим паролям
17 июля 2026, 22:17 | Oleksandr Bazanov

Компания 1Password официально объявила о запуске интеграции с ИИ-платформой Claude от Anthropic. Новая функция позволяет искусственному интеллекту использовать сохраненные в менеджере паролей учетные данные для выполнения действий в браузере, при этом сами пароли остаются недоступными как для Claude, так и для серверов Anthropic.

Подробнее...
 
OpenAI представила свое первое устройство: компактная клавиатура Codex Micro для разработчиков
OpenAI представила свое первое устройство: компактная клавиатура Codex Micro для разработчиков
17 июля 2026, 14:07 | Roter

OpenAI официально вышла на рынок аппаратного обеспечения, однако первое устройство компании оказалось совсем не тем, чего ожидали многие. Вместо компактного ИИ-гаджета без экрана, о котором в последние недели активно писали инсайдеры, компания представила Codex Micro — программируемую механическую клавиатуру для разработчиков, работающих с платформой Codex.

Подробнее...
 
Samsung ускоряет строительство нового завода по выпуску чипов ради бума искусственного интеллекта
Samsung ускоряет строительство нового завода по выпуску чипов ради бума искусственного интеллекта
17 июля 2026, 12:07 | Anton Petrov

Samsung Electronics решила значительно ускорить реализацию одного из крупнейших проектов в своей истории. На фоне стремительного роста спроса на чипы для искусственного интеллекта компания намерена запустить первый завод в новом полупроводниковом комплексе в Йонъине на два года раньше, чем планировалось изначально.

Подробнее...
 
Страницы: 1 2 3 4 5 6
Полная версия
 
© 2012-2026 iLenta. All rights reserved.