AI и анализ данных — это не одно и то же, что «AI знает много фактов». Смотрите, в чём тут дело: нейросеть может идеально пересказать теорию, но споткнуться там, где нужно принять решение в условиях неопределённости. Именно это противоречие исследует новый бенчмарк от OpenAI — GeneBench-Pro. И хотя он про вычислительную биологию, выводы из него куда шире.
Что такое GeneBench-Pro и зачем он вообще нужен
GeneBench-Pro — это набор из 129 задач, которые проверяют, способна ли нейросеть делать то, что реальные учёные называют «научным суждением». Не воспроизводить формулы по памяти, а принимать решения в условиях неопределённости: какие данные надёжны, какой метод анализа выбрать, когда результат достаточно убедителен для вывода.
Задачи охватывают геномику, количественную биологию и трансляционную медицину — области, где «правильный ответ» редко лежит на поверхности. Каждая задача — это реалистичный, намеренно «грязный» датасет плюс краткий контекст эксперимента. Модели нужно исследовать данные, выбрать подходящий аналитический путь и дать финальный ответ.
Тут есть нюанс: задачи специально сконструированы синтетически, то есть создатели бенчмарка заранее знают правильный ответ и могут проверить его детерминированно. Это избавляет от ситуации, когда две модели выбирают разные, но одинаково обоснованные решения — и непонятно, кто «лучше».
Что показали результаты: цифры, которые стоит запомнить
Лучшая на момент публикации модель — GPT‑5.6 Sol — решила 28,7% задач на максимальном уровне сложности (31,5% в режиме Pro). Звучит скромно? Для контекста: когда OpenAI только начинала строить предыдущий бенчмарк, лучшая модель набирала менее 5%.
Несколько наблюдений, которые важны:
- Масштаб вычислений на этапе ответа имеет значение. На минимальном уровне рассуждений та же модель показывает однозначный процент. На максимальном — решает почти в шесть раз больше задач, чем GPT‑5.2, при этом тратит примерно на треть меньше токенов.
- Разрыв между закрытыми и открытыми моделями больше, чем ожидалось. Если смотреть только на задачи по программированию, разница между GPT‑5.6 и лучшими открытыми моделями невелика. Но на задачах с научным суждением разрыв резко увеличивается. Открытые модели пока лучше заточены под код, чем под широкое рассуждение.
- Человек-эксперт тратит на одну задачу 20–40 часов, по оценке рецензентов. При стоимости $200 в час — это тысячи долларов на задачу. AI справляется за несколько долларов инференса. Даже при 28% успеха экономический смысл уже есть.
Почему «знать факты» и «уметь думать» — разные навыки
Это и есть центральный вывод, который применим далеко за пределами биологии.
Авторы бенчмарка описывают провал моделей так: они делают частичный прогресс на сложных задачах, но не могут «замкнуть вывод». Собирают наблюдения, но не интегрируют их в общую картину. Это точно то же самое, что отличает эксперта от новичка: эксперт опирается на опыт, чтобы сформулировать задачу и адаптировать подход по ходу. Новичок видит отдельные факты, но теряется, когда они противоречат друг другу.
Для тех, кто работает с AI в маркетинге или создании контента, это прямой сигнал: нейросеть хорошо справляется с задачами, где есть чёткая инструкция и понятный критерий результата. Там, где нужно взвешивать варианты, менять план по ходу и принимать решение в условиях неполных данных — человек пока необходим.
Если вы думаете, как AI меняет поисковое поведение и видимость контента, — загляните в разбор Query Fan-Out и AI-видимость контента: там это показано на конкретных механизмах.
Что это значит для маркетолога и эксперта прямо сейчас
Давайте по шагам разберём, что из этого практически применимо.
- AI хорош в рутинном анализе — делегируйте его смело. Там, где задача повторяемая и критерий успеха понятен (обработка таблицы, первичный анализ данных, структурирование информации), нейросети работают надёжно и быстро.
- Не ждите от AI «интуиции». Если задача требует пересмотра исходных предположений по ходу работы — держите человека в контуре. AI пока не умеет сам себе сказать «подождите, тут что-то не так».
- Следите за развитием моделей. Прыжок с 5% до 28% за относительно короткое время — это не мелочь. Авторы бенчмарка прямо пишут: при текущей скорости прогресса задачи могут быть насыщены к концу года.
- Думайте о стоимости, а не только о точности. Даже если AI решает треть задач уровня эксперта — при разнице в цене в сотни раз это уже меняет экономику работы.
О том, как AI-агенты уже меняют рабочие процессы на практике, есть отдельный разбор: AI-агенты в маркетинге: автоматизация без навыков программиста.
Ловушка, о которой мало говорят: деквалификация
Тут есть важный обратный эффект. Чем лучше AI справляется с рутинным анализом, тем больше соблазн полностью отдать ему эти задачи. И тем быстрее атрофируется навык у человека, который перестаёт их делать сам.
В контексте GeneBench-Pro это выглядит так: если эксперт перестаёт самостоятельно проходить аналитический путь — он теряет способность замечать, когда AI ошибается. А ошибается AI именно там, где нужно «замкнуть вывод».
Для маркетолога и эксперта сценарий тот же: если вы перестаёте понимать логику своей воронки, своего контента, своей аналитики — вы не сможете поймать AI на ошибке. Вы просто будете масштабировать неправильное.
Подробнее об этой ловушке — в статье Что нельзя отдавать AI: ловушка деквалификации в маркетинге.
Почему прогресс AI важно отслеживать, даже если вы не учёный
GeneBench-Pro — это про биологию. Но принцип, который он проверяет, универсален: способность AI делать суждения в условиях неопределённости.
Маркетинг, продажи, создание контента — всё это тоже про суждения. Какой заголовок точнее попадает в аудиторию? Когда аудитория готова к предложению, а когда нет? Почему воронка не работает — проблема в оффере или в трафике?
Пока AI решает меньше трети задач такого класса в биологии — в маркетинге картина, вероятно, схожая. Это не повод игнорировать нейросети. Это повод использовать их там, где они сильны, и не передоверять им то, где они пока слабы.
Если хотите следить за тем, как меняется ситуация с AI и видимостью брендов в нейросетевых поисковиках, — есть хорошая отправная точка: AI-видимость бренда: как отслеживать упоминания в нейросетях.
Если вам интересно, как это всё укладывается в практику — без теории ради теории, а конкретно для вашего контента и продаж — заходите в мой Telegram-канал. Там разборы, наблюдения и живые примеры.
По мотивам материала OpenAI News «Introducing GeneBench-Pro».
Частые вопросы
Что такое GeneBench-Pro простыми словами?
Насколько хорошо ChatGPT справляется с анализом данных?
Может ли AI заменить аналитика в маркетинге?
Зачем маркетологу следить за развитием AI-бенчмарков?

100 нейросетей
для экспертов
Подборка, которой реально пользуются — пришлю на почту. Без спама, отписка в один клик.
любых задач
и эффективности
и карьеры
Комментарии
Будьте первым — поделитесь мыслями или задайте вопрос.
Чтобы оставить комментарий — войдите
Это пара кликов. Чтобы избежать спама — только зарегистрированные пользователи. Никакой рассылки, только если вы сами захотите.