Claude Code скасовує ручні підтвердження: переваги та небезпеки

Claude Code скасовує ручні підтвердження: переваги та небезпеки 7

Фото до статті

Claude Code скасовує ручні підтвердження: переваги та небезпеки 8

Олександр Остапенко

Автор новин

Claude Code скасовує ручні підтвердження: переваги та небезпеки 9

Claude Code скасовує ручні підтвердження: переваги та небезпеки 10

Claude Code скасовує ручні підтвердження: переваги та небезпеки 11

Anthropic розпочинає перехід Claude Code в автоматичний режим (auto mode) за замовчуванням для тарифів Pro, Max та Team. Ця зміна набуде чинності 14 серпня. Компанія аргументує своє рішення тим, що агент, який функціонує без постійних запитів на верифікацію, є більш надійним порівняно з людиною, яка підтверджує кожен крок.

Claude Code скасовує ручні підтвердження: переваги та небезпеки 12

Питання підтверджень раніше обговорювалося віце-президенткою Anthropic Кет Ву та інженером-програмістом Таріком Шіхіпаром на конференції AI Engineer World’s Fair. Вони зазначили, що всередині Anthropic «майже кожен користується автоматичним режимом», і що загрози промпт-ін’єкцій та витоку даних у цьому режимі є меншими, ніж під час людської перевірки.

Що таке автоматичний режим

Замість зупинки перед кожною дією для отримання дозволу, автоматичний режим пропускає кожен виклик інструменту через спеціальний класифікатор. Цей класифікатор блокує дії, які є незворотними, руйнівними або спрямовані поза межі робочого середовища користувача. Якщо класифікатор блокує команду, Claude або шукає безпечніший спосіб виконання завдання самостійно, або звертається до користувача за прямим запитом. У разі відсутності прогресу — три блокування поспіль або двадцять за сесію — Claude Code автоматично повертається до ручного підтвердження.

Окремо функціонує захист від «жорстких заборон»: дії, пов’язані з ексфільтрацією даних (наприклад, відправлення коду чи секретної інформації), класифікатор не дозволяє в жодному разі; для цього необхідно вручну вимкнути автоматичний режим.

Переваги: цифри, якими оперує Anthropic

Компанія наводить кілька досліджень на підтримку свого рішення:

  • Контрольований експеримент за участю 1053 платних тестувальників. У середині сесії один із запитів на дозвіл було підмінено на явно небезпечну команду. Люди розпізнали загрозу лише в 13,6% випадків (143 з 1053), тоді як автоматичний режим заблокував 89% (937 з 1053). При цьому, чим довшою була сесія, тим гіршою ставала людська уважність — з 17% на початку до 5% після 50+ попередніх запитів, тоді як показник автоматичного режиму залишався стабільним.
  • Аналіз реальних сесій за травень–червень 2026 року. Серед сесій, позначених системою безпеки для перевірки, ручне схвалення вдвічі частіше супроводжувалося серйозними ненавмисними пошкодженнями: на рівні «промислової» тяжкості (7+ балів з 10) це становило 6,3% сесій з ручним підтвердженням проти 2,4% в автоматичному режимі.
  • Тестування на промпт-ін’єкції від незалежної компанії Trajectory Labs. З 720 спроб атаки на моделі Claude Fable 5, Opus 5 та Sonnet 5 в автоматичному режимі не вдалася жодна. Для порівняння: у GPT-5.6 Sol в режимі Codex «Auto-review» відсоток успішних атак становив 5,83%, а в режимі повного доступу — 19,03%.
  • Продуктивність. За даними Anthropic, серед команд та корпоративних клієнтів користувачі автоматичного режиму створюють приблизно на 25% більше pull request’ів, оскільки агент може працювати без перерв годинами — наприклад, сесія Claude Opus 5, запущена ввечері, здатна надати готові PR вже вранці.
  • Практичні приклади. Компанія навела три випадки, коли класифікатор у межах самої Anthropic зупинив: спробу опублікувати внутрішній звіт на публічному сервісі після невдалого завантаження на закритий диск; масове видалення близько двох тисяч подів із запущеними тренуваннями моделей; та надання надлишкових прав адміністратора замість запитуваного доступу «лише для читання» до білінгу.

Клієнти, такі як Adobe, Nuro, Gusto та Garner Health, вже використовують автоматичний режим як стандартний у своїх виробничих процесах.

Недоліки та застереження

Незважаючи на оптимістичну статистику, в самому пакеті даних та в коментарях незалежних оглядачів присутня низка застережень:

  • 11% небезпечних дій автоматичний режим не відловив навіть у контрольованому тесті — це означає, що повного захисту немає.
  • Класифікатор не усуває ризик, а лише зменшує його. Сама Anthropic наголошує, що для критично важливих змін у виробничій інфраструктурі варто й надалі перевіряти дії Claude вручну.
  • Відомий дослідник Саймон Віллісон, який висвітлює цю тему, застерігає: він хотів би незалежного підтвердження заявлених 0% успішних атак, адже сценарій, коли шкідливий пакет інструктує агента послідовно виконати спочатку нібито нешкідливу, а потім шкідливу команду, залишається, на його думку, важко покритим таким типом захисту.
  • Тестування на промпт-ін’єкції проводилося через однакову браузерну інтеграцію від Trajectory Labs, а не через фірмові розширення, як-от Chrome-плагіни Anthropic чи OpenAI — отже, результати скоріше характеризують саму модель, аніж повний набір захисних механізмів у конкретному продукті.
  • Аналіз показав, що значна частина користувачів і так вже «клікає на автоматі»: 97% запитів на дозвіл схвалюються без роздумів, 62% хоча б раз використовували режим bypassPermissions, а 25% інтерактивних сесій одразу стартують без перевірок — тобто поточна «ручна» модель безпеки вже й так є слабкою, і порівняння частково йде не з ідеальною, а з реальною практикою.

Для Enterprise-клієнтів, користувачів Claude API, AWS, Google Cloud та Microsoft Foundry автоматичний режим поки залишається опціональним — Anthropic планує зробити його стандартом там протягом найближчого місяця. Перемкнути режим вручну можна комбінацією Shift+Tab у CLI або через випадаюче меню в десктоп-додатку.

Нагадаємо, кілька днів тому Anthropic запустила безкоштовний курс Claude Code in Action для розробників.

Головна > Новини > Anthropic вимикає ручні підтвердження в Claude Code: переваги та ризики

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *