ШІ теж може "передумувати" – Microsoft показала, коли довші міркування лише заважають
Здається логічним, що чим довше ШІ «думає», тим кращою буде відповідь. Microsoft Research показала протилежну проблему: модель може продовжувати міркування навіть після правильного проміжного рішення. Новий метод скоротив цей процес на 36,8%.
Зміст14
- Що таке міркування ШІ і чому вони стали такими важливими
- Що таке underthinking і overthinking у ШІ
- Чому довші міркування ШІ не завжди кращі
- Що таке TRAAC і як Microsoft скорочує зайві міркування ШІ
- Наскільки TRAAC скоротив міркування ШІ
- На яких задачах перевіряли міркування ШІ
- Чи означає overthinking, що ШІ починає сумніватися у правильній відповіді
- Чи пов'язана довга відповідь ChatGPT із overthinking
- Чому міркування ШІ важливі для звичайного користувача
- Коли довші міркування ШІ справді потрібні
- Чи можна самому змусити ШІ менше "думати"
- Чи можна вже використовувати TRAAC у ChatGPT або Copilot
- Чому скорочення міркування ШІ може бути важливим
- Що дослідження Microsoft насправді змінює
Чим довше штучний інтелект "думає" над складною задачею, тим точнішою має бути відповідь. На перший погляд це здається логічним, але нове дослідження Microsoft Research показує складнішу картину. Міркування ШІ можуть бути як занадто короткими, так і надмірно довгими, а більше обчислень саме по собі не гарантує кращого результату.
Дослідники Microsoft Research зосередилися на двох протилежних проблемах сучасних reasoning-моделей: underthinking, коли ШІ припиняє міркування надто рано, та overthinking, коли продовжує генерувати непотрібні кроки навіть після того, як уже дійшов до правильного проміжного рішення.
Для боротьби з цим автори створили метод TRAAC. У випробуваннях на кількох типах завдань він дав моделі Qwen3-4B середній абсолютний приріст точності на 8,4% при одночасному скороченні довжини міркування на 36,8% порівняно з базовою моделлю. Це важливий результат: ШІ не обов'язково потрібно "думати" довше, щоб відповідати краще.
Що таке міркування ШІ і чому вони стали такими важливими
Міркування ШІ – це обчислювальний процес, під час якого модель витрачає додаткові ресурси на складну задачу перед формуванням фінальної відповіді. Для сучасних reasoning-моделей такий підхід особливо важливий у математиці, логіці та інших завданнях, де правильний результат залежить від кількох послідовних кроків.
Один зі способів покращити результат – збільшити test-time compute, тобто обчислювальні ресурси, доступні моделі безпосередньо під час розв'язання задачі. Але Microsoft Research звертає увагу на важливе обмеження: обчислювальний бюджет має відповідати складності конкретного завдання.
Якщо міркування ШІ занадто короткі, складній задачі може просто не вистачити необхідних проміжних кроків. Якщо вони надмірно довгі, модель починає витрачати токени на дії, які вже не допомагають отримати правильну відповідь.
Саме тому довжина міркування не повинна бути однаковою для всіх задач. Просте запитання та складна математична проблема потребують різної кількості обчислень.
Що таке underthinking і overthinking у ШІ
Underthinking та overthinking – це дві протилежні ситуації, коли модель неправильно розподіляє обчислювальний бюджет. У першому випадку міркування ШІ завершуються надто рано, у другому – тривають довше, ніж потрібно.
Microsoft Research об'єднує цю проблему поняттям under-adaptivity. Воно означає, що модель недостатньо добре змінює довжину своїх міркувань залежно від складності конкретної задачі.
Ситуація | Що відбувається | Можливий наслідок |
|---|---|---|
Underthinking | Міркування ШІ завершуються занадто рано | Моделі не вистачає кроків для складної задачі |
Адаптивне міркування | Обсяг обчислень відповідає складності | Модель використовує необхідний reasoning-бюджет |
Overthinking | Міркування ШІ продовжуються надмірно довго | З'являються непотрібні кроки та зайві витрати токенів |
Головна проблема полягає не просто в довгій або короткій відповіді. ШІ має навчитися визначати, скільки міркування насправді потребує конкретна задача.
Це доповнює іншу проблему сучасних моделей – нестабільність результатів. На Gosta детально розібрано, чому ШІ відповідає по-різному на те саме і яку системну причину цього раніше виявили дослідники Microsoft.
Чому довші міркування ШІ не завжди кращі
Довші міркування ШІ корисні лише тоді, коли додаткові кроки справді потрібні для розв'язання задачі. Якщо модель уже отримала правильне проміжне рішення, подальше генерування reasoning може стати зайвим.
Саме такий сценарій Microsoft Research називає overthinking. Модель продовжує витрачати токени навіть після того, як досягла коректного проміжного результату.
Це важливо через сам принцип роботи сучасних thinking-моделей. Якщо просто дозволяти системі використовувати дедалі більше test-time compute, не контролюючи відповідність складності задачі, частина додаткових обчислень може не приносити користі.
Більше reasoning – не те саме, що краще reasoning. Значення має не максимальна кількість кроків, а здатність моделі використати достатню кількість корисних кроків і вчасно відкинути зайві.
Що таке TRAAC і як Microsoft скорочує зайві міркування ШІ
TRAAC – це запропонований дослідниками метод Think Right with Adaptive, Attentive Compression, який має допомогти моделі балансувати між недостатнім і надмірним міркуванням. Він поєднує оцінювання складності задачі з відбором важливих частин довгої reasoning-траєкторії.
Метод використовує self-attention самої моделі для визначення важливих кроків у довгому ланцюжку міркування. Надлишкові частини можна відсікати, залишаючи ті, які мають більше значення для розв'язання задачі.
TRAAC також оцінює складність прикладу та враховує її під час формування винагороди в процесі навчання. У результаті модель вчиться розподіляти reasoning-бюджет відповідно до складності.
Тобто Microsoft не пропонує просто встановити однакову максимальну довжину для кожної відповіді. Складна задача може отримати більше міркування, а простіша – менше, якщо додаткові кроки вже не потрібні.
Наскільки TRAAC скоротив міркування ШІ
У тестах Microsoft Research метод TRAAC одночасно підвищив точність і скоротив довжину reasoning. Саме поєднання цих двох результатів є ключовою частиною роботи Think Right.
Дослідники випробовували TRAAC із моделлю Qwen3-4B на різних наборах задач, серед яких AIME, AMC, GPQA-D та BBEH.
Порівняння | Зміна точності | Зміна довжини міркування |
|---|---|---|
TRAAC проти базової моделі | +8,4% абсолютної точності | -36,8% |
TRAAC проти найкращого RL baseline | +7,9% | -29,4% |
Отже, результат не зводиться до механічного скорочення reasoning. Порівняно з базовою моделлю TRAAC у середньому скоротив довжину міркування на 36,8% і водночас дав абсолютний приріст точності на 8,4%.
У порівнянні з найкращим RL baseline автори отримали приріст точності на 7,9% разом зі скороченням довжини на 29,4%. Це показує, що ефективніше використання reasoning-бюджету може поєднувати економію обчислень із покращенням результату.
На яких задачах перевіряли міркування ШІ
TRAAC перевіряли не на одному типі тестів. У дослідженні використані AIME, AMC, GPQA-D та BBEH, що дозволило оцінити поведінку моделі на різних за характером задачах.
Особливо важливим є тест на перенесення отриманого підходу за межі навчальних даних. Моделі TRAAC навчали на математичних датасетах, але покращення точності та ефективності зберігалися і на нематематичних наборах GPQA-D, BBEH та OptimalThinkingBench.
Це означає, що результат не обмежився лише математичними прикладами, на яких відбувалося навчання. Автори зафіксували узагальнення підходу на задачах поза початковим навчальним розподілом.
Однак із цього не випливає, що TRAAC уже довів однакову ефективність у будь-якому можливому сценарії використання ШІ. Результати стосуються конкретних моделей, методики та наборів завдань, описаних у дослідженні.
Чи означає overthinking, що ШІ починає сумніватися у правильній відповіді
Ні. Слово overthinking тут використовується як технічне поняття й не означає людські сумніви, тривожність або психологічне "накручування себе". Модель не переживає через свою відповідь.
Йдеться про неефективне використання обчислювального бюджету. Міркування ШІ можуть продовжуватися навіть після отримання правильного проміжного рішення, створюючи непотрібні кроки.
Тому фраза "ШІ передумує" добре пояснює явище на побутовому рівні, але її не слід розуміти буквально. Overthinking у дослідженні Microsoft – це проблема надмірної довжини reasoning відносно того, що реально потрібно для задачі.
Чи пов'язана довга відповідь ChatGPT із overthinking
Довга відповідь ChatGPT сама по собі не доводить, що відбулося overthinking. Видимий користувачеві текст і reasoning-процес моделі – не одне й те саме.
Наприклад, користувач може попросити детальну статтю на кілька тисяч слів. Довжина такого результату буде наслідком самого завдання, а не обов'язково надмірного reasoning.
Так само коротка фінальна відповідь не означає, що ШІ витратив мало обчислень на її отримання. Складна задача може потребувати значного reasoning-бюджету, навіть якщо користувачеві в результаті показують лише кілька речень.
Тому оцінювати якість міркування ШІ за довжиною видимої відповіді некоректно. Think Right стосується того, наскільки добре модель адаптує сам процес reasoning до складності задачі.
Чому міркування ШІ важливі для звичайного користувача
Для користувача головна перевага ефективніших міркувань ШІ потенційно полягає в тому, що модель витрачає обчислення там, де вони справді потрібні. Це важливо для складних задач, де просте збільшення кількості reasoning-кроків не є оптимальним рішенням.
Сучасний ШІ дедалі частіше використовується не лише для коротких відповідей. Йому доручають аналіз інформації, програмування, планування та задачі з багатьма обмеженнями, де потрібно послідовно врахувати кілька факторів.
Наприклад, ШІ для подорожей у 2026 році може одночасно працювати з бюджетом, датами, маршрутом, транспортом та іншими умовами.
Чим складнішими стають такі сценарії, тим важливішою стає здатність моделі правильно розподіляти обчислення. Занадто коротке reasoning може пропустити важливу умову, а надмірне – створити непотрібні проміжні кроки.
Коли довші міркування ШІ справді потрібні
Довші міркування ШІ найбільш виправдані в задачах, де правильна відповідь залежить від кількох послідовних операцій. Microsoft Research прямо пов'язує проблему underthinking зі складними завданнями, для яких потрібні розширені reasoning-кроки.
Типовими прикладами таких задач можуть бути:
Багатокрокові математичні обчислення.
Логічні задачі з кількома взаємопов'язаними умовами.
Складний аналіз, де потрібно врахувати багато обмежень.
Задачі, де проміжний результат впливає на наступні кроки.
Сценарії, де перед фінальною відповіддю потрібно зіставити кілька факторів.
У таких випадках примусове скорочення міркування може бути так само небажаним, як і його надмірне збільшення. Саме тому TRAAC намагається зробити reasoning адаптивним, а не просто коротшим.
Чи можна самому змусити ШІ менше "думати"
Дослідження Microsoft не є інструкцією для користувача щодо налаштування ChatGPT, Copilot або іншого чат-бота. TRAAC – метод навчання reasoning-моделей, а не кнопка чи параметр, який користувач може активувати в чаті.
Водночас якість запиту залишається важливою. Чітке формулювання задачі, необхідні вихідні дані та конкретні обмеження допомагають моделі зрозуміти, який результат потрібен.
Але довший промпт сам по собі не гарантує кращої відповіді так само, як і довші міркування ШІ не гарантують більшої точності. Для складних завдань важливіше правильно сформулювати умови та перевірити фінальний результат.
Чи можна вже використовувати TRAAC у ChatGPT або Copilot
Ні, офіційна публікація Microsoft Research не повідомляє про запуск TRAAC як користувацької функції ChatGPT, Microsoft Copilot або іншого масового сервісу. Think Right є дослідницькою роботою.
Це принципове уточнення. Результати дослідження показують можливість зробити reasoning ефективнішим, але не підтверджують, що Microsoft уже інтегрувала TRAAC у Copilot.
Так само TRAAC не є новим режимом ChatGPT. У роботі експерименти проводилися з Qwen3-4B, тому переносити конкретні показники 8,4% або 36,8% на ChatGPT, Copilot чи інші моделі не можна.
Чому скорочення міркування ШІ може бути важливим
Непотрібні reasoning-кроки означають не лише довший внутрішній ланцюжок. Вони пов'язані з використанням токенів і test-time compute, тобто ресурсів, які модель витрачає безпосередньо під час виконання задачі.
Якщо частину таких кроків можна прибрати без втрати якості, модель використовує обчислювальний бюджет ефективніше. Дослідження Think Right цікаве саме тим, що в експериментах скорочення reasoning не супроводжувалося падінням точності – навпаки, автори отримали її приріст.
У масштабі розвитку reasoning-моделей це змінює сам підхід до покращення ШІ. Завдання полягає не лише в тому, щоб дати моделі більше обчислень, а й у тому, щоб навчити її правильно ними розпоряджатися.
На Gosta вже є окремий матеріал про вплив ChatGPT на технологічний світ, де детальніше розібрано, як розвиток генеративного ШІ змінює звичні цифрові сценарії.
Що дослідження Microsoft насправді змінює
Think Right показує проблему, яка стає дедалі важливішою в міру розвитку reasoning-моделей. Просте масштабування test-time compute має межу корисності, якщо система не вміє співвідносити обсяг міркування зі складністю задачі.
TRAAC пропонує інший підхід: оцінювати складність, знаходити важливі частини довгої reasoning-траєкторії та прибирати надлишкові. У тестах це дозволило одночасно скоротити міркування ШІ та підвищити точність.
Найважливіший висновок для користувача простий: довше "думання" ШІ не є автоматично ознакою розумнішої відповіді. Значно важливіше, чи використовує модель достатню кількість правильних кроків для конкретної задачі.
Преміальний партнер розділу «Технології»Samsung

FAQ про міркування ШІ та overthinking
Чи може ШІ міркувати занадто довго?
Так. Microsoft Research описує overthinking як ситуацію, коли reasoning стає надмірно довгим і модель генерує непотрібні кроки навіть після правильного проміжного рішення.
Що таке міркування ШІ?
Міркування ШІ в контексті reasoning-моделей – це використання додаткових обчислювальних кроків для розв'язання задачі перед формуванням фінального результату. Складніші задачі можуть потребувати більшого reasoning-бюджету.
Що таке overthinking у ШІ?
Overthinking – це надмірне міркування ШІ, коли модель використовує більше reasoning-кроків, ніж потрібно для конкретної задачі. Microsoft Research вказує, що це може призводити до неефективного використання токенів.
Що таке underthinking у ШІ?
Underthinking виникає, коли міркування ШІ занадто короткі для складної задачі. У такому випадку модель може помилитися через недостатню кількість необхідних reasoning-кроків.
Що таке TRAAC від Microsoft?
TRAAC розшифровується як Think Right with Adaptive, Attentive Compression. Це метод, який використовує self-attention для визначення важливих частин довгого reasoning і відсіювання надлишкових, а також враховує складність задачі під час навчання.
Наскільки TRAAC скоротив міркування ШІ?
У тестах із Qwen3-4B TRAAC скоротив довжину reasoning у середньому на 36,8% порівняно з базовою моделлю. Водночас абсолютна точність у середньому зросла на 8,4%.
Чи означає довша відповідь ChatGPT, що ШІ занадто довго міркував?
Ні. Довжина видимої відповіді та внутрішній reasoning-процес не є одним і тим самим. Довгий текст може бути просто форматом, який попросив користувач.
Чи завжди довші міркування ШІ дають точнішу відповідь?
Ні. Дослідження Microsoft показує, що надмірне reasoning може створювати непотрібні кроки. Оптимальний обсяг міркування має залежати від складності конкретної задачі.
Чи працює TRAAC у Microsoft Copilot?
Microsoft Research не повідомляє про впровадження TRAAC у Copilot як користувацької функції. Think Right є дослідницькою роботою.
Найкраще за тиждень — на пошту
Без спаму. Лише топ-матеріали Gosta. Відписатись в один клік.






Коментарі