Компания Google 25 марта на своем сайте представила новую версию нейросети Gemini 2.5 Pro, которая умеет работать с разными типами данных в рамках единого контекста. Модель позиционируется как инструмент для сложных задач: анализ длинных документов и генерацию кода, сказано в пресс-релизе.
Gemini 2.5 Pro поддерживает контекстное окно, то есть список команд, объемом до одного миллиона токенов. Для сравнения, контекстное окно нейросети DeepSeek составляет всего 128 тысяч элементов. Один миллион элементов эквивалентен анализу видео продолжительностью до 3 часов или текстовых файлов размером с небольшую библиотеку. Как сообщает новостное издание Ars Technica, данная нейросеть лидирует в нескольких математических и научных бенчмарках1 — AIME 2025 (математика) и GPQA diamond (наука). Кроме того, она набрала 18,8% в Humanity’s Last Exam («Последний экзамен человечества») — сложной проверочной работе, которая состоит из 3000 академических вопросов по математике, гуманитарным и естественным дисциплинам.
В отличие от своих предшественников, она может создавать код с учетом нюансов языков программирования, таких как Python, Java и Rust. По информации сайта 9to5Google, в стандартизированном тесте на разработку программного обеспечения (SWE-Bench Verified) модель набрала 63.8%, что указывает на ее эффективность при решении многоступенчатых задач по программированию.

Эксперт по продуктам генеративного искусственного интеллекта Эрик Хэл Шварц в своем блоге сравнил новую модель от Google с ChatGPT-4. В тестах на логическое мышление Gemini 2.5 Pro показала на 18% более высокие результаты, чем GPT-4, при решении задач с неполными данными, таких как прогнозирование рыночных трендов на основе фрагментарной информации. Однако модель уступает ChatGPT в креативных сценариях: например, при генерации поэтических текстов или нестандартных маркетинговых идей. В эксперименте с расшифровкой аудио, где фоном был шум в 70 дБ, точность транскрибации составила 92% против 84% у ChatGPT. Кроме того, Gemini 2.5 Pro корректно описывает сцены из видео даже при низком разрешении (до 240 пикселей).
Только спустя 3 недели после запуска самой мощной на текущий момент разработки искусственного интеллекта под названием Gemini 2.5 Pro компания Google опубликовала технический отчёт. В нём представлены результаты внутренних проверок безопасности. Однако в отчёте содержится мало данных, позволяющих проанализировать потенциальные угрозы этой разработкой.
Программисты указали, что в отчёте не упоминается «Система безопасности на передовой» (Frontier Safety Framework, FSF) — инструмент, который Google представил в 2024 году для выявления возможностей искусственного интеллекта, которые могут причинить серьёзный ущерб. Также в технической документации Google отсутствуют подробности о механизмах, которые блокируют дезинформацию или представляющие опасность инструкции.

«В этом отчёте информации очень мало, он был опубликован спустя несколько недель после того, как модель уже стала общедоступной, — в интервью TechCrunch рассказал Питер Уайлдфорд, соучредитель Института политики и стратегии в области ИИ. — Невозможно проверить, выполняет ли Google свои публичные обязательства, и, следовательно, невозможно оценить безопасность этих технологий».
Талси Доши, директор Gemini, рассказала в интервью интернет-ресурсу TechCrunch от 3 апреля 2025 года, не публиковала технический отчет для Gemini 2.5 Pro, потому что эта модель Gemini — «экспериментальный» релиз.
«Мы всё ещё пытаемся понять, как выпускать эти модели, чтобы получать обратную связь», — сказал Доши.

Здесь все о бытовых вещах: борьба с мошенниками, банковские продукты, роботы вместо фармацевтов. Приходите на страницу этого автора, чтобы понять, какие технологии уже окружают нас в обычной жизни!
