Кратко
Контент-анализ — это метод исследования, при котором содержание текстов и других сообщений кодируют по заранее заданным категориям и анализируют количественно или качественно. Он превращает живую речь — открытые ответы, расшифровки, публикации — в данные, которые может воспроизвести другой исследователь.

Текста в работе психолога намного больше, чем цифр: развёрнутые ответы в опроснике, расшифровка сессии, дневниковые записи, переписка, публикации в СМИ. Прочитать всё это внимательно несложно — сложнее объяснить, почему выводы получились именно такими, а не другими. Контент-анализ решает ровно эту задачу: он превращает текст в данные по правилам, которые записаны заранее и которые может применить другой исследователь. Ниже — устройство метода, разница между количественной и качественной ветвями и места, где он чаще всего разваливается.
Что такое контент-анализ
Контент-анализ (англ. content analysis) — метод, при котором содержание сообщений разбирают по заранее заданной процедуре: материал делят на единицы, каждой присваивают категорию из готового списка и смотрят, как категории распределились. Хрестоматийную формулировку в 1952 году предложил американский исследователь коммуникации Бернард Берельсон: объективное, систематическое и количественное описание явного содержания сообщения. Клаус Криппендорф позднее определил метод шире — как технику, позволяющую делать воспроизводимые и обоснованные выводы о контексте, в котором текст возник. Словарь Американской психологической ассоциации трактует его в том же ключе: систематическая процедура кодирования тем в качественном материале.
Ключевое слово — процедура. Ценность метода не во внимательном чтении, а в том, что правила зафиксированы до знакомства с результатом и любой человек способен их повторить. Материалом становится всё, что несёт смысл: расшифровки интервью, школьные сочинения, реклама, посты в соцсетях, обращения в службу поддержки, протоколы наблюдения.
Появился метод за пределами психологии — в исследованиях прессы и военной пропаганды середины XX века, когда аналитики кодировали газетные материалы, чтобы судить о намерениях противника. Психология подхватила его позже, и он занял свою нишу: работу с тем, что не укладывается в шкалу, — с живой речью.
Количественный и качественный варианты
Количественная ветвь отвечает на вопрос «сколько»: как часто в материале встречается тема, как категории связаны друг с другом, меняется ли картина от года к году. Она опирается на явное содержание — то, что сказано прямо, — и завершается числами и статистикой.
Качественная ветвь спрашивает «как именно» и допускает латентное содержание: умолчание, иронию, рамку, в которую помещено событие. Сие и Шеннон в 2005 году описали три её разновидности, и эта классификация до сих пор рабочая: конвенциональная (категории вырастают из самого материала), направленная (анализ стартует с категорий существующей теории и уточняет её) и суммативная (сперва подсчёт ключевых слов, затем истолкование того, что за ними стоит). Немецкий методолог Филипп Майринг ещё раньше показал: качественный анализ не равен вольной трактовке, у него есть пошаговые процедуры — обобщение, объяснение, структурирование, — и центр тяжести в них приходится на систему категорий.
На практике граница подвижна. Можно вывести категории индуктивно, а затем посчитать их частоты; можно взять теоретические категории и проиллюстрировать цитатами. Спор «качественный или количественный» менее важен, чем вопрос, достаточно ли подробно описана процедура для повторения.
Разница видна на одном и том же материале. Возьмём сто откликов о первом визите к психологу: количественный подход посчитает, в скольких упомянуты цена, время ожидания и страх осуждения, и сравнит доли. Качественный присмотрится к формулировкам страха — как к собственной слабости, как к реакции окружения или как к недоверию специалисту — и вернёт сначала не число, а систему смыслов, которую потом тоже можно посчитать.
Единицы, категории и кодировочная книга
Криппендорф разводит несколько уровней единиц, и путаница между ними — типичная ошибка новичка. Единица отбора попадает в выборку: одна статья, одна расшифровка, один пост. Единица кодирования получает категорию: предложение, реплика, отдельное упоминание. Единица контекста задаёт, сколько текста кодировщик вправе прочесть, чтобы понять смысл фрагмента: иногда хватает фразы, иногда нужен весь абзац.
Затем выстраивают систему категорий. Требования к ней звучат просто, а выполняются тяжело: категории должны быть взаимоисключающими (фрагмент подходит только под одну), исчерпывающими (для любого фрагмента находится место) и выведенными из исследовательского вопроса, а не из того, что показалось любопытным при чтении.
Всё это закрепляет кодировочная книга: для каждой категории в ней есть название, определение, правило отнесения, примеры «да» и примеры «нет», а также решения для спорных случаев. Проверка её качества проста: сможет ли человек, не участвовавший в разработке, закодировать материал по книге без устных пояснений автора.
Выглядит это довольно приземлённо. Допустим, исследовательница смотрит, как подростки описывают ссору с родителями, и вводит категорию «перенос ответственности». В книге появится запись: сюда относятся высказывания, где причина конфликта приписана исключительно другой стороне; пример «да» — «они первые начали»; пример «нет» — «мы оба наговорили лишнего»; фрагменты с двумя причинами кодируются по названной первой. Такие мелкие решения и отличают метод от пересказа впечатлений.

Согласие кодировщиков: почему без него метода нет
Методом контент-анализ становится тогда, когда результат перестаёт зависеть от конкретного человека. Поэтому материал — хотя бы его часть — кодируют минимум два независимых кодировщика, не видящие решений друг друга и не обсуждающие спорные фрагменты по ходу работы.
Совпадение измеряют не процентами. Фраза «сошлись в 85 % случаев» завышает оценку, потому что часть совпадений даёт случайность: при двух категориях наугад кодировщики сойдутся примерно в половине фрагментов. Отсюда меры с поправкой на случайность: каппа Коэна — для двух кодировщиков и номинальных категорий, альфа Криппендорфа — для любого числа кодировщиков, разных уровней измерения и пропусков в данных.
Криппендорф даёт практический ориентир: значения от 0,80 позволяют опираться на данные, интервал примерно 0,67–0,80 — только на осторожные выводы, ниже — результат считается ненадёжным. Он же предупреждает о подмене: если кодировщики сначала вместе разобрали трудные места, а согласие посчитали после, число описывает достигнутую договорённость, а не качество инструкции.
Верный порядок другой: пилотное кодирование небольшой части материала, разбор расхождений, доработка книги — и лишь затем независимое кодирование основного массива с подсчётом согласия. Так удаётся удержать критерии от незаметного дрейфа и ослабить предубеждение, из-за которого исследователь находит в тексте ожидаемое.
Где психологу пригодится контент-анализ
Первое и самое частое — открытые ответы. Представим, что центр собрал восемьсот ответов на вопрос, что мешало обратиться за помощью раньше. Прочитать их реально, а вот сравнить две группы клиентов на глаз уже нет. Контент-анализ делает данными то, что при анкетировании обычно остаётся на полях отчёта.
Второе — речь в кабинете. Расшифровки сессий кодируют в исследованиях процесса терапии: как меняется доля высказываний о себе, когда впервые возникают темы, которых клиент избегал. Работа идёт только с информированного согласия и с обезличенным текстом, и рядом с ней почти всегда стоит супервизия для психолога, где те же фрагменты разбирают уже как практику, а не как данные.
Третье — медиа и социальные сети. Представим исследовательницу, которая изучает, как издания пишут о профессиональном выгорании: она отбирает триста материалов за год и кодирует каждый по рамке подачи — обвиняющая работника, нейтральная, поддерживающая. На выходе получается не «правда об обществе», а карта того, какой образ проблемы читатель встречает чаще всего.
Четвёртое — собственные протоколы исследователя. Записи, сделанные во время наблюдения, сами по себе текст, и до подсчёта частот их тоже приводят к категориям.
Пятое — личные документы. Дневники, письма, сочинения, рассказы о жизненном пути традиционно анализируют именно так: категориями, а не пересказом. Этот материал незаменим там, где опросник бессилен, — когда нужно понять, как человек объясняет себе собственные перемены.
Машинное кодирование текста и его пределы
С двухтысячных ручное кодирование всё чаще идёт вместе с программным. Самый известный подход словарный: программа считает, какая доля слов текста попадает в заранее собранные категории. Таушчик и Пеннебейкер в 2010 году обобщили этот опыт и указали на неожиданное: больше всего говорят не содержательные слова, а служебные. В частности, повышенная доля местоимений первого лица единственного числа связана с негативным аффектом и сосредоточенностью на себе.
Дальше метод ушёл в большие данные. В работе 2018 года язык постов в соцсети, которые пациенты добровольно предоставили вместе с доступом к медицинской карте, позволял предсказать появление записи о депрессии за несколько месяцев до первой врачебной фиксации. Впечатляет, но точность здесь групповая: речь о тенденции в выборке, а не о диагнозе конкретному человеку.
Ограничения словарных методов прямолинейны: программа не улавливает иронию, отрицание и контекст, а категории словаря составлял человек со своими представлениями. Поэтому автоматическую разметку проверяют ручным кодированием на подвыборке, а сам инструмент проходит ту же проверку на валидность, что и любая методика.
Частые ошибки
- Пересекающиеся категории. Если фрагмент одинаково подходит под две рубрики, кодировщики разойдутся, и виновата будет схема, а не их внимательность.
- Единственный кодировщик. Разметка, сделанная автором исследования без проверки согласия, остаётся изложением его впечатлений.
- Частота вместо значимости. Самая частая тема — просто самая заметная; важным нередко оказывается то, о чём молчат.
- Удобный материал. Триста постов из одного телеграм-канала описывают именно этот канал, а не аудиторию вообще — вопрос к выборке, а не к кодированию.
- Причинность из частот. Контент-анализ показывает, что и как представлено и как категории связаны; почему это так — вопрос к другому дизайну исследования.
Тема входит и в программу ЕФВВ по психологии, поэтому студенту стоит держать в голове не только определение Берельсона, но и логику метода: единицы, категории, согласие кодировщиков, границы обобщения.
Мифы и факты о контент-анализе
| На самом деле | Распространённый миф |
|---|---|
| Это процедура с правилами, которые можно повторить | Контент-анализ — просто внимательное чтение текста |
| Подход выбирают под вопрос: бывает и количественный, и качественный | Метод годится только для подсчёта слов |
| Частота показывает заметность темы, а не её значимость | Чем чаще слово, тем важнее тема |
| Нужны минимум два независимых кодировщика | Хватит одного исследователя, если он добросовестен |
| Метод описывает содержание и связи, причины проверяет эксперимент | Контент-анализ доказывает, что одно вызывает другое |
| Программа считает слова, а смысл всё равно приписывает человек | Машинное кодирование делает анализ объективным |
Источники
- APA Dictionary of Psychology: контент-анализ.
- Hsieh H.-F., Shannon S. E. Three Approaches to Qualitative Content Analysis. Qualitative Health Research, 2005; 15(9):1277–1288. PubMed
- Krippendorff K. Reliability in Content Analysis: Some Common Misconceptions and Recommendations. Human Communication Research, 2004; 30(3):411–433. Полный текст
- Mayring P. Qualitative Content Analysis. Forum Qualitative Sozialforschung, 2000; 1(2), Art. 20. Полный текст
- Berelson B. Content Analysis in Communication Research. Free Press, 1952.
- Krippendorff K. Content Analysis: An Introduction to Its Methodology. 4-е изд. SAGE, 2018.
- Cohen J. A Coefficient of Agreement for Nominal Scales. Educational and Psychological Measurement, 1960; 20(1):37–46. DOI: 10.1177/001316446002000104.
- Tausczik Y. R., Pennebaker J. W. The Psychological Meaning of Words: LIWC and Computerized Text Analysis Methods. Journal of Language and Social Psychology, 2010; 29(1):24–54. DOI: 10.1177/0261927X09351676.
- Eichstaedt J. C. и др. Facebook Language Predicts Depression in Medical Records. PNAS, 2018; 115(44):11203–11208. DOI: 10.1073/pnas.1802331115 · PMID: 30322910.
Часто задаваемые вопросы
Что такое контент-анализ простыми словами?
Это способ превратить текст в данные по чётким правилам. Исследователь заранее решает, какие фрагменты текста он рассматривает и какие категории к ним применяет, а затем считает, как категории распределились. От обычного чтения метод отличает то, что правила записаны до анализа, поэтому другой человек может повторить процедуру и получить тот же результат.
Чем контент-анализ отличается от тематического анализа?
Оба метода ищут в тексте темы, но контент-анализ изначально нацелен на систематичность и воспроизводимость: фиксированная кодировочная книга, подсчёт частот, измеряемое согласие кодировщиков. Тематический анализ гибче и допускает достройку категорий по ходу работы, поэтому его результат труднее проверить числом.
Сколько нужно кодировщиков и какое согласие считается достаточным?
Минимум двое, кодирующих независимо и не видящих решений друг друга. Согласие измеряют мерами с поправкой на случайное совпадение — каппой Коэна или альфой Криппендорфа. Практический ориентир: от 0,80 выводы считают надёжными, в интервале около 0,67–0,80 — только предварительными, ниже материал перекодируют.
Можно ли анализировать расшифровки терапевтических сессий?
Да, это один из основных методов исследования процесса терапии, но только с информированного согласия клиента и на полностью обезличенном тексте. Материал хранят отдельно от персональных данных, а объём цитирования в публикации ограничивают. Клинический разбор того же фрагмента ради практики — уже другой формат работы.
Заменяет ли компьютерная программа ручное кодирование?
Нет. Автоматические словари хорошо считают частоты слов, но не улавливают иронию, отрицание и контекст, да и сами категории словаря составлял человек. Поэтому машинную разметку проверяют ручным кодированием на части материала. Как вообще проверяют качество психологических методик, наглядно видно на примере психологических тестов онлайн.
72 отзыва — средняя оценка центра New Leaf