Штучний інтелект не сприймає час — і навіть не усвідомлює цього

Штучний інтелект не сприймає час — і навіть не усвідомлює цього 3

Фото до статті

Андрій Савчук

Автор новин

Недавнє дослідження показало: популярні асистенти на базі штучного інтелекту не спроможні точно прогнозувати тривалість виконання завдання, так само як і достовірно оцінювати свій робочий час над ним. Для завдань, що виконуються автономно протягом багатьох годин, це створює реальні проблеми для контролю з боку людини — пише The Decoder.

Штучний інтелект не сприймає час — і навіть не усвідомлює цього 4

Хто і як це перевіряв

Дослідження провели два незалежні експерти зі штучного інтелекту в рамках дослідницької програми MATS. Вони перевірили два поширених кодувальних асистенти — Claude Code від Anthropic та Codex від OpenAI — на їхню здатність відчувати час.

Перед кожним завданням з програмування агенти повинні були оцінити, скільки часу їм знадобиться. Потім вони вирішували завдання і після його виконання звітували, скільки часу, на їхню думку, минуло. Для тестів використовувалися 200 завдань зі збірки ProgramBench, а також власний набір дослідників із 18 бенчмарків під назвою AgentTime.

Агенти систематично завищують оцінки часу

У процесі тестування агенти стабільно переоцінювали необхідний час. У ProgramBench обидві моделі переважно вказували приблизно 90 хвилин, незалежно від фактичної складності завдання. У другому етапі тестування Claude помилявся в середньому втричі, а Codex — у шість-десять разів. Найгірші показники були зафіксовані на коротких завданнях, і лише в діапазоні кількох годин деякі прогнози наближалися до реальності.

Згідно з даними авторів дослідження, на бенчмарку AgentTime модель Fable 5 у середньому перевищувала фактичний час виконання приблизно втричі, а GPT-5.6 Sol — приблизно в сім разів, причому найбільша розбіжність спостерігалася саме на коротких завданнях.

Одна й та сама модель поводиться по-різному залежно від оточення

Результати значно варіюються залежно від програмного середовища (harness), у якому працює модель. Claude Code продовжує роботу доти, доки не вважатиме завдання виконаним, — медіанний час становить близько 90 хвилин. Codex, навпаки, зупиняється приблизно через півгодини, майже незалежно від складності завдання. Згідно з дослідженням, та сама мовна модель у середньому робить на 2,5 раза більше кроків у Claude Code, ніж у Codex. Отже, тривалість роботи залежить не тільки від самої моделі, але й значною мірою від програмного середовища, в якому вона функціонує.

Агенти так само погано оцінюють якість власної роботи

Старіші моделі — Opus 4.8 та GPT-5.5 — у середньому завищували оцінку власних результатів на 20 пунктів і присуджували собі високі бали навіть за невдалі завдання. В одному з випадків обидві моделі оцінили власну роботу приблизно на 70% успішності, тоді як реальні показники становили 7% і 14,5% відповідно.

Чому це важливо

Дослідники підкреслюють, що здатність до самооцінки є важливою. Щоб агент міг надійно працювати над довготривалими завданнями, які тривають годинами, він мусить вміти виконувати інструкції на кшталт «попрацюй над цим завданням протягом двох годин». Агента, який постійно неправильно оцінює час, складно контролювати.

Надалі автори планують дослідити, чи здатні агенти дотримуватися встановленої тривалості роботи. Цікаво, що коли агентам надавали доступ до інструмента, який повідомляв про реальний перебіг часу, вони майже завжди давали правильну відповідь — це свідчить про те, що проблема полягає не в принциповій нездатності орієнтуватися в часі, а саме у відсутності стандартного доступу до відповідної інформації.

Нагадаємо, що Claude Opus 5 за один запит створив повноцінний шутер у стилі Call of Duty.

Головна > Новини > Штучний інтелект не відчуває часу — і навіть не підозрює про це

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *