Коротко
Дилема в'язня — класична задача теорії ігор про ситуацію, у якій кожному учаснику окремо вигідно діяти проти іншого, а разом обидва отримують гірший результат, ніж дала б взаємна довіра. Вона описує не риси характеру, а структуру ситуації, яка штовхає людей до взаємної зради.

Двоє спільників сидять у різних камерах і не можуть перемовитися. Слідчий пропонує кожному одне й те саме: даси свідчення, поки напарник мовчить, — вийдеш на волю, а він сяде надовго; промовчите обидва — обом дістануться символічні звинувачення; заговорите обидва — обом дадуть середній строк. Хоч би що зробив інший, кожному окремо вигідніше заговорити. А коли обидва чинять «вигідно», обидва отримують гірший результат, ніж якби мовчали. Дилема в'язня — це найкоротший опис ситуації, у якій розумна поведінка кожного шкодить обом. Саме тому її згадують не лише на лекціях з теорії ігор, а й щоразу, коли йдеться про довіру між людьми.
Звідки взялася задача і хто вигадав історію про в'язнів
Гру придумали не юристи й не психологи. На початку 1950 року двоє математиків корпорації RAND, Меррілл Флуд і Мелвін Дрешер, перевіряли просту річ: чи навчаться люди, граючи багато разів поспіль, доходити до розв'язку, який сьогодні називають рівновагою Неша. Вони вмовили двох колег зіграти гру з такою структурою виграшів сто разів поспіль, а через два роки результати вийшли звітом RAND.
Історію про двох в'язнів, слідчого і строки додав математик Альберт Таккер — щоб зробити ідею зрозумілою аудиторії психологів у Стенфорді. Саме завдяки цьому сюжету задача стала загальновідомою.
А ось назву Таккеру приписують помилково, і цю неточність повторюють навіть поважні джерела. Найраніше друковане вживання терміна «дилема в'язня» — книжка Люса і Райфи 1957 року. Плутанина виникла через те, що роздатковий матеріал доповіді Таккера надрукували аж через 33 роки з підзаголовком «Дилема двох осіб: дилема в'язня» — в оригінальному мімеографі 1950 року такого підзаголовка не було.
Цікава деталь: чернетку звіту читав Джон Неш і залишив коментар, що досвідчені учасники в повторюваній грі не трималися передбаченої теорією постійної зради — але з цього, на його думку, ще не випливає, що в одноразовій грі зрада була б нерозумною.
Структура виграшів: чому кожному окремо вигідно зрадити
У теорії ігор ситуацію описують не характерами, а чотирма можливими результатами. Кожен учасник має два ходи: співпрацювати (мовчати) або зрадити (заговорити).
| Ваш хід | Інший мовчить | Інший здає |
|---|---|---|
| Ви мовчите | Винагорода: обидва отримують символічний строк | Програш довірливого: він виходить, ви сідаєте надовго |
| Ви здаєте | Спокуса: ви виходите, він сідає надовго | Покарання: обидва отримують середній строк |
Виграші впорядковані в один ланцюжок: спокуса зради більша за винагороду за спільне мовчання, покарання за взаємну зраду гірше від цієї винагороди, а найгірший результат дістається тому, хто мовчав на самоті. З цього випливає неприємне: хоч би що обрав інший, зрада дає вам більше. Такий хід називають домінантним — він вигідніший за всі інші незалежно від чужого рішення.
Пара «обидва зраджують» і є рівновагою Неша: станом, у якому жоден не виграв би, змінивши свій хід поодинці. Водночас цей результат гірший для обох, ніж взаємна співпраця. Саме розрив між тим, що розумно для одного, і тим, що вигідно для двох, робить задачу дилемою, а не арифметикою.
Ще одна деталь, яку часто плутають: це не гра з нульовою сумою. Виграш одного тут не дорівнює програшу іншого, тож разом учасники можуть отримати і більше, і менше.
Чому повторювана гра змінює все
Одноразова зустріч і довга серія зустрічей — дві різні задачі. У сучасних дослідженнях повторювану дилему задають не фіксованою кількістю раундів, а ймовірністю, що гра триватиме далі; цю ймовірність називають тінню майбутнього. Чим вона більша, тим дорожча співпраця й тим дешевша разова вигода від зради. Цим пояснюють навіть побутові спостереження: чому рівень взаємної ввічливості вищий у селі, ніж у великому місті, і чому в сусідньому кафе лишають кращі чайові, ніж у випадковому закладі біля траси.
Еволюційна біологія формулює те саме правило суворіше: пряма взаємність утримує співпрацю лише тоді, коли ймовірність нової зустрічі з тим самим партнером перевищує співвідношення ціни допомоги до її користі. Інакше кажучи, співпраця тримається не на доброті, а на очікуванні продовження.
Скінченна гра з наперед відомою кількістю раундів створює окремий парадокс. Міркування від кінця до початку, яке називають зворотною індукцією, велить зраджувати вже з першого ходу: в останньому раунді майбутнього немає, отже, і сенсу співпрацювати теж. Люди так не грають. На практиці поведінка в довгих іграх фіксованої довжини майже не відрізняється від поведінки в іграх невизначеної тривалості — за винятком кількох останніх раундів. Радше це свідчить, що припущення про ідеальну раціональність гравців надто сильні.
Турніри Акселрода: як перемогла найпростіша стратегія
Політолог Роберт Акселрод підійшов до питання інакше: він запросив фахівців із різних дисциплін надіслати програми-стратегії для повторюваної дилеми й зіштовхнув їх між собою в турнірі. Переміг Tit-for-Tat, «око за око», Анатоля Рапопорта — стратегія з двох правил: у першому раунді співпрацюй, далі просто повторюй попередній хід суперника.
Важливіша навіть не перша перемога, а друга. У другому турнірі змагалися шістдесят три учасники, і кожен уже мав на руках результати першого — тобто знав, кого перемагати. «Око за око» перемогло знову.
Акселрод пояснив цей успіх чотирма властивостями: стратегія добра (ніколи не зраджує першою), відповідає на зраду, пробачає (готова повернутися до співпраці, щойно суперник перестав зраджувати) і зрозуміла супернику. Показова цифра: вісім «добрих» стратегій першого турніру посіли рівно вісім верхніх місць. Саме звідси пішла ідея, що в довгій грі виграє не хитрість, а надійність.
Чому «око за око» не вічний переможець
Цей висновок часто переказують як закон природи, і тут варто зупинитися. У турнірах, проведених на конференціях IEEE у Портленді 2004 року й Колчестері 2005-го, умови Акселрода відтворили точніше — і в тому з них, що був найближчий до оригіналу, «око за око» посіло лише 14-те місце з 50.
Переміг колектив Саутгемптонського університету, який подав понад половину з 223 допущених стратегій: частина його програм упізнавала «свою» за кодовою послідовністю ходів і свідомо годувала її очками. Тобто виграла не стратегія, а чисельність. Найбільше постраждав критерій зрозумілості: дві найсильніші стратегії того турніру — Adaptive Pavlov і Omega Tit for Tat — аж ніяк не прості.
Ще раніше, 1993 року, Мартін Новак і Карл Зіґмунд показали, що «око за око» перевершує стратегія «виграв — не міняй, програв — зміни» (Pavlov): вона виправляє випадкові помилки й не дає безумовним кооператорам накопичитися в популяції, а саме вони згодом запрошують туди зрадників. Пізніший аналіз 2015 року додав ще один аргумент: якщо замість турніру «кожен з кожним» розбити учасників на групи й провести фінал між переможцями груп, то стратегії, які в першому турнірі Акселрода посіли друге і шосте місця, виступають помітно краще за «око за око».
Практичний висновок простий: немає стратегії, яка виграє завжди. Є структура турніру, склад суперників і ціна помилки — і вже вони вирішують, що спрацює.
Якщо звести типові лінії поведінки разом, різниця між ними стає очевидною: безумовні стратегії — співпрацювати завжди або зраджувати завжди — не зважають на партнера взагалі, тоді як «око за око» і Pavlov реагують на його хід, кожна по-своєму.

Це не про егоїзм, а про структуру ситуації
Найчастіша помилка в побутових переказах — читати дилему як тест на порядність. Найбільший на сьогодні метааналіз соціальних дилем зібрав емпірику за шість десятиліть (понад 2300 вибірок, близько 229 тисяч учасників) і показав інше: чим менший конфлікт інтересів у самій ситуації, тим більше співпраці, а найсильніше її підсилюють дві речі — санкції та можливість поговорити. Розмір групи й спосіб підбору партнерів стабільного ефекту не дали, а симетрія дилеми, черговість рішень і оплата участі взагалі не були пов'язані з рівнем співпраці.
Для звичайного читача це головне, що варто винести. Змінюється не характер, а конструкція ситуації: та сама людина співпрацює в одній рамці й захищається в іншій. Але помічати це важко, бо ми схильні пояснювати чужий вибір рисою вдачі, а власний — обставинами; так працює фундаментальна помилка атрибуції. Механізм, яким ми взагалі приписуємо вчинкам причини, описує каузальна атрибуція — і в дилемі він збиває з пантелику особливо часто.
Що це пояснює в переговорах, у парі та в командах
У переговорах дилема пояснює, чому сторони, кожна з яких боїться поступитися першою, виходять із гіршою угодою, ніж могли б. Два важелі, які дають найбільший ефект у даних, — саме ті, що доступні за столом: говорити прямо й робити домовленості такими, щоб їх було невигідно порушувати.
У парі дилема працює як метафора, а не як модель: у близьких стосунках немає ні анонімності, ні одноразовості, ні фіксованої таблиці виграшів. Але механізм упізнаваний. Коли кожен заздалегідь захищається — «не проситиму, бо все одно не дадуть», «не скажу перший, бо використає», — обидва опиняються в клітинці взаємної зради, куди не хотів жоден.
У командах структуру створюють правила. Якщо премію ділять так, що успіх колеги зменшує вашу частку, ви отримали дилему в'язня в чистому вигляді — і пояснювати наслідки «токсичністю людей» чи конформізмом марно. Є й третій важіль, який у людей працює поза прямим обміном, — репутація: допомога створює добре ім'я, і винагороджує її вже не той, кому ви допомогли, а хтось інший. Це називають непрямою взаємністю, і саме заради неї люди так уважно стежать за чужими вчинками й обговорюють їх.
Якщо недовіра стала звичним тлом близьких стосунків і розмови раз по раз закінчуються взаємним захистом, це привід розібратися з патерном разом із фахівцем — наприклад, у форматі онлайн-психотерапії, а не шукати, хто з двох «зрадник».
Чи справді люди кооперуються не думаючи
Теорія передбачає взаємну зраду, але в лабораторії люди поводяться інакше: частка кооперативних виборів в експериментах може сягати 80 % — залежно від того, як відкалібрували виграші. Звідси й давня спокуса пояснити співпрацю природною добротою.
2012 року з'явилася гучна гіпотеза: кооперація інтуїтивна, а егоїзм — результат роздумів. Далі історія повчальна. У великій передреєстрованій реплікації ефект часового тиску не підтвердився, а метааналіз 82 експериментів за участю 29 315 людей дав приріст співпраці 2,19 відсоткового пункту — і цей приріст тримається майже цілком на шести дослідженнях, де учасників прямо просили покладатися на емоції; без них ефект падає приблизно до одного пункту і стає статистично незначущим. Автори прямо пишуть, що переконливих доказів гіпотези отримати не вдалося. Ця історія — хороший приклад того, як працює критичне мислення в науці: красиву ідею перевірили, і вона не встояла.
Ще одне дослідження додало деталь: швидкість рішення взагалі не відрізняє кооператора від зрадника. Швидко вирішують і найбільш кооперативні, і найбільш егоїстичні учасники, а довше думають ті, хто схильний ділити порівну й підлаштовуватися під поведінку партнера.
Міфи і факти про дилему в'язня
| Насправді | Поширений міф |
|---|---|
| Сюжет належить Таккеру, а назву вперше надруковано в книжці Люса і Райфи 1957 року | Назву «дилема в'язня» придумав Таккер |
| У турнірі 2004–2005 років, найближчому до умов Акселрода, вона посіла 14-те місце з 50 | «Око за око» — найкраща стратегія назавжди |
| Частка кооперативних виборів в експериментах сягає 80 % залежно від виграшів | Дилема доводить, що люди за природою егоїсти |
| Ефект тримається на шести дослідженнях з індукцією емоцій; без них він зникає | Доведено, що співпраця інтуїтивна, а розрахунок робить людину егоїстом |
| Виграш одного не дорівнює програшу іншого: разом можна отримати і більше, і менше | Дилема в'язня — гра з нульовою сумою |
| Найсильніше поведінку змінюють санкції і можливість поговорити | Усе залежить від того, порядна людина чи ні |
Джерела
- Kuhn S. Prisoner's Dilemma. Stanford Encyclopedia of Philosophy, 1997, суттєва редакція 24.10.2025 (історія задачі, структура виграшів, турніри Акселрода й розділ «Post-Axelrod»). Повний текст
- Axelrod R. The Evolution of Cooperation. New York: Basic Books, 1984 (обидва турніри й чотири властивості стратегії «око за око»).
- Nowak M., Sigmund K. A strategy of win-stay, lose-shift that outperforms tit-for-tat in the Prisoner's Dilemma game. Nature, 1993; 364(6432):56–58. DOI: 10.1038/364056a0 · PMID: 8316296.
- Nowak M. A. Five rules for the evolution of cooperation. Science, 2006; 314(5805):1560–1563. DOI: 10.1126/science.1133755 · PMID: 17158317 (пряма і непряма взаємність, роль репутації). Повний текст
- Heuer L., Orland A. Cooperation in the Prisoner's Dilemma: an experimental comparison between pure and mixed strategies. Royal Society Open Science, 2019; 6(7):182142. DOI: 10.1098/rsos.182142 · PMID: 31417702 · PMC: PMC6689633 (частка кооперативних виборів у лабораторії).
- Kvarven A. та ін. The intuitive cooperation hypothesis revisited: a meta-analytic examination of effect size and between-study heterogeneity. Journal of the Economic Science Association, 2020; 6(1):26–42. DOI: 10.1007/s40881-020-00084-3 (82 експерименти, 29 315 учасників). Повний текст
- Montero-Porras E. та ін. Fast deliberation is related to unconditional behaviour in iterated Prisoners' Dilemma experiments. Scientific Reports, 2022; 12:20287. DOI: 10.1038/s41598-022-24849-4 · PMID: 36434077. Повний текст
- Jin S., Spadaro G., Balliet D. Institutions and cooperation: A meta-analysis of structural features in social dilemmas. Journal of Personality and Social Psychology, 2025; 129(2):286–312. DOI: 10.1037/pspi0000474 · PMID: 39446642 (k = 2340, N = 229 528; санкції та комунікація).
Часто задавані питання
Що таке дилема в'язня простими словами?
Це ситуація, у якій двоє не можуть домовитися, і кожному окремо вигідно вчинити на шкоду іншому. Якщо обидва підуть за власною вигодою, обидва втратять більше, ніж якби довірилися один одному. Сюжет із двома підозрюваними — лише ілюстрація: та сама структура працює в конкуренції, переговорах і навіть у поділі домашніх обов'язків.
Що таке рівновага Неша в цій грі?
Рівновага Неша — комбінація ходів, за якої жоден учасник не покращить свій результат, змінивши рішення поодинці. У дилемі в'язня така комбінація одна: обидва зраджують. Парадокс у тому, що цей стійкий результат гірший для кожного, ніж взаємна співпраця, яку ніхто не наважується обрати першим.
Чи є дилема в'язня грою з нульовою сумою?
Ні. У грі з нульовою сумою виграш одного точно дорівнює програшу іншого, а тут результати учасників можуть зростати й падати разом. Тому в таблиці є клітинка, вигідна обом одночасно, і клітинка, у якій програють обидва. Саме ненульова сума робить задачу цікавою для психології, а не лише для математики.
Чому в повторюваній грі люди співпрацюють частіше?
Бо з'являється майбутнє. Коли учасники знають, що зустрінуться знову, сьогоднішня зрада оплачується завтрашньою відмовою партнера, і разова вигода знецінюється. Дослідники називають це тінню майбутнього: що вища ймовірність нової зустрічі, то дорожча співпраця. Той самий ефект видно в житті — з постійними сусідами поводяться інакше, ніж із випадковими.
Де дилема в'язня трапляється в повсякденні?
Скрізь, де особиста вигода оплачується спільною втратою. Двоє конкурентів знижують ціни й обидва втрачають прибуток; колеги притримують інформацію, бо премію ділять між ними; партнери мовчать про свої потреби, щоб не стати вразливими. Структура однакова: захищаючись поодинці, обидві сторони отримують гірший результат, ніж дала б домовленість.
Що таке стратегія Pavlov у теорії ігор?
Це правило «виграв — не міняй хід, програв — зміни», описане Новаком і Зіґмундом 1993 року. У симуляціях вона перевершила «око за око» за двома ознаками: виправляє випадкові помилки й не дає безумовним кооператорам заповнити популяцію. Побутовий аналог — звичайний висновок із досвіду: спрацювало, отже повторюю; не спрацювало, отже пробую інакше.
Чи показує вибір у дилемі, наскільки людина порядна?
Ні, і це важливе застереження. Дані великих метааналізів показують, що поведінку визначає передусім конструкція ситуації: рівень конфлікту інтересів, наявність санкцій і можливість спілкуватися. Та сама людина в різних умовах обирає по-різному, тож робити з одного ходу висновок про характер некоректно.
Чи можна виграти в дилемі в'язня?
У разовій грі виграшу у звичному сенсі немає: найбільший особистий результат дістається тому, хто зрадив довірливого партнера, але таким ходом він закриває шлях до подальшої співпраці. У довгій серії стабільний результат дає не хитрість, а передбачувана поведінка: починати зі співпраці, відповідати на зраду й повертатися до співпраці, щойно партнер зупинився.
73 відгуки — середня оцінка центру New Leaf