New Leaf — Психологічний центр

Психологический словарь

Контент-анализ в психологии: этапы, виды и надёжность кодирования

Методы исследования и психодиагностика

Кратко

Контент-анализ — это метод исследования, при котором содержание текстов и других сообщений кодируют по заранее заданным категориям и анализируют количественно или качественно. Он превращает живую речь — открытые ответы, расшифровки, публикации — в данные, которые может воспроизвести другой исследователь.

Контент-анализ

Текста в работе психолога намного больше, чем цифр: развёрнутые ответы в опроснике, расшифровка сессии, дневниковые записи, переписка, публикации в СМИ. Прочитать всё это внимательно несложно — сложнее объяснить, почему выводы получились именно такими, а не другими. Контент-анализ решает ровно эту задачу: он превращает текст в данные по правилам, которые записаны заранее и которые может применить другой исследователь. Ниже — устройство метода, разница между количественной и качественной ветвями и места, где он чаще всего разваливается.

Что такое контент-анализ

Контент-анализ (англ. content analysis) — метод, при котором содержание сообщений разбирают по заранее заданной процедуре: материал делят на единицы, каждой присваивают категорию из готового списка и смотрят, как категории распределились. Хрестоматийную формулировку в 1952 году предложил американский исследователь коммуникации Бернард Берельсон: объективное, систематическое и количественное описание явного содержания сообщения. Клаус Криппендорф позднее определил метод шире — как технику, позволяющую делать воспроизводимые и обоснованные выводы о контексте, в котором текст возник. Словарь Американской психологической ассоциации трактует его в том же ключе: систематическая процедура кодирования тем в качественном материале.

Ключевое слово — процедура. Ценность метода не во внимательном чтении, а в том, что правила зафиксированы до знакомства с результатом и любой человек способен их повторить. Материалом становится всё, что несёт смысл: расшифровки интервью, школьные сочинения, реклама, посты в соцсетях, обращения в службу поддержки, протоколы наблюдения.

Появился метод за пределами психологии — в исследованиях прессы и военной пропаганды середины XX века, когда аналитики кодировали газетные материалы, чтобы судить о намерениях противника. Психология подхватила его позже, и он занял свою нишу: работу с тем, что не укладывается в шкалу, — с живой речью.

Количественный и качественный варианты

Количественная ветвь отвечает на вопрос «сколько»: как часто в материале встречается тема, как категории связаны друг с другом, меняется ли картина от года к году. Она опирается на явное содержание — то, что сказано прямо, — и завершается числами и статистикой.

Качественная ветвь спрашивает «как именно» и допускает латентное содержание: умолчание, иронию, рамку, в которую помещено событие. Сие и Шеннон в 2005 году описали три её разновидности, и эта классификация до сих пор рабочая: конвенциональная (категории вырастают из самого материала), направленная (анализ стартует с категорий существующей теории и уточняет её) и суммативная (сперва подсчёт ключевых слов, затем истолкование того, что за ними стоит). Немецкий методолог Филипп Майринг ещё раньше показал: качественный анализ не равен вольной трактовке, у него есть пошаговые процедуры — обобщение, объяснение, структурирование, — и центр тяжести в них приходится на систему категорий.

На практике граница подвижна. Можно вывести категории индуктивно, а затем посчитать их частоты; можно взять теоретические категории и проиллюстрировать цитатами. Спор «качественный или количественный» менее важен, чем вопрос, достаточно ли подробно описана процедура для повторения.

Разница видна на одном и том же материале. Возьмём сто откликов о первом визите к психологу: количественный подход посчитает, в скольких упомянуты цена, время ожидания и страх осуждения, и сравнит доли. Качественный присмотрится к формулировкам страха — как к собственной слабости, как к реакции окружения или как к недоверию специалисту — и вернёт сначала не число, а систему смыслов, которую потом тоже можно посчитать.

Единицы, категории и кодировочная книга

Криппендорф разводит несколько уровней единиц, и путаница между ними — типичная ошибка новичка. Единица отбора попадает в выборку: одна статья, одна расшифровка, один пост. Единица кодирования получает категорию: предложение, реплика, отдельное упоминание. Единица контекста задаёт, сколько текста кодировщик вправе прочесть, чтобы понять смысл фрагмента: иногда хватает фразы, иногда нужен весь абзац.

Затем выстраивают систему категорий. Требования к ней звучат просто, а выполняются тяжело: категории должны быть взаимоисключающими (фрагмент подходит только под одну), исчерпывающими (для любого фрагмента находится место) и выведенными из исследовательского вопроса, а не из того, что показалось любопытным при чтении.

Всё это закрепляет кодировочная книга: для каждой категории в ней есть название, определение, правило отнесения, примеры «да» и примеры «нет», а также решения для спорных случаев. Проверка её качества проста: сможет ли человек, не участвовавший в разработке, закодировать материал по книге без устных пояснений автора.

Выглядит это довольно приземлённо. Допустим, исследовательница смотрит, как подростки описывают ссору с родителями, и вводит категорию «перенос ответственности». В книге появится запись: сюда относятся высказывания, где причина конфликта приписана исключительно другой стороне; пример «да» — «они первые начали»; пример «нет» — «мы оба наговорили лишнего»; фрагменты с двумя причинами кодируются по названной первой. Такие мелкие решения и отличают метод от пересказа впечатлений.

Этапы контент-анализа: вопрос и материал, единицы и категории, кодирование, анализ

Согласие кодировщиков: почему без него метода нет

Методом контент-анализ становится тогда, когда результат перестаёт зависеть от конкретного человека. Поэтому материал — хотя бы его часть — кодируют минимум два независимых кодировщика, не видящие решений друг друга и не обсуждающие спорные фрагменты по ходу работы.

Совпадение измеряют не процентами. Фраза «сошлись в 85 % случаев» завышает оценку, потому что часть совпадений даёт случайность: при двух категориях наугад кодировщики сойдутся примерно в половине фрагментов. Отсюда меры с поправкой на случайность: каппа Коэна — для двух кодировщиков и номинальных категорий, альфа Криппендорфа — для любого числа кодировщиков, разных уровней измерения и пропусков в данных.

Криппендорф даёт практический ориентир: значения от 0,80 позволяют опираться на данные, интервал примерно 0,67–0,80 — только на осторожные выводы, ниже — результат считается ненадёжным. Он же предупреждает о подмене: если кодировщики сначала вместе разобрали трудные места, а согласие посчитали после, число описывает достигнутую договорённость, а не качество инструкции.

Верный порядок другой: пилотное кодирование небольшой части материала, разбор расхождений, доработка книги — и лишь затем независимое кодирование основного массива с подсчётом согласия. Так удаётся удержать критерии от незаметного дрейфа и ослабить предубеждение, из-за которого исследователь находит в тексте ожидаемое.

Где психологу пригодится контент-анализ

Первое и самое частое — открытые ответы. Представим, что центр собрал восемьсот ответов на вопрос, что мешало обратиться за помощью раньше. Прочитать их реально, а вот сравнить две группы клиентов на глаз уже нет. Контент-анализ делает данными то, что при анкетировании обычно остаётся на полях отчёта.

Второе — речь в кабинете. Расшифровки сессий кодируют в исследованиях процесса терапии: как меняется доля высказываний о себе, когда впервые возникают темы, которых клиент избегал. Работа идёт только с информированного согласия и с обезличенным текстом, и рядом с ней почти всегда стоит супервизия для психолога, где те же фрагменты разбирают уже как практику, а не как данные.

Третье — медиа и социальные сети. Представим исследовательницу, которая изучает, как издания пишут о профессиональном выгорании: она отбирает триста материалов за год и кодирует каждый по рамке подачи — обвиняющая работника, нейтральная, поддерживающая. На выходе получается не «правда об обществе», а карта того, какой образ проблемы читатель встречает чаще всего.

Четвёртое — собственные протоколы исследователя. Записи, сделанные во время наблюдения, сами по себе текст, и до подсчёта частот их тоже приводят к категориям.

Пятое — личные документы. Дневники, письма, сочинения, рассказы о жизненном пути традиционно анализируют именно так: категориями, а не пересказом. Этот материал незаменим там, где опросник бессилен, — когда нужно понять, как человек объясняет себе собственные перемены.

Машинное кодирование текста и его пределы

С двухтысячных ручное кодирование всё чаще идёт вместе с программным. Самый известный подход словарный: программа считает, какая доля слов текста попадает в заранее собранные категории. Таушчик и Пеннебейкер в 2010 году обобщили этот опыт и указали на неожиданное: больше всего говорят не содержательные слова, а служебные. В частности, повышенная доля местоимений первого лица единственного числа связана с негативным аффектом и сосредоточенностью на себе.

Дальше метод ушёл в большие данные. В работе 2018 года язык постов в соцсети, которые пациенты добровольно предоставили вместе с доступом к медицинской карте, позволял предсказать появление записи о депрессии за несколько месяцев до первой врачебной фиксации. Впечатляет, но точность здесь групповая: речь о тенденции в выборке, а не о диагнозе конкретному человеку.

Ограничения словарных методов прямолинейны: программа не улавливает иронию, отрицание и контекст, а категории словаря составлял человек со своими представлениями. Поэтому автоматическую разметку проверяют ручным кодированием на подвыборке, а сам инструмент проходит ту же проверку на валидность, что и любая методика.

Частые ошибки

  • Пересекающиеся категории. Если фрагмент одинаково подходит под две рубрики, кодировщики разойдутся, и виновата будет схема, а не их внимательность.
  • Единственный кодировщик. Разметка, сделанная автором исследования без проверки согласия, остаётся изложением его впечатлений.
  • Частота вместо значимости. Самая частая тема — просто самая заметная; важным нередко оказывается то, о чём молчат.
  • Удобный материал. Триста постов из одного телеграм-канала описывают именно этот канал, а не аудиторию вообще — вопрос к выборке, а не к кодированию.
  • Причинность из частот. Контент-анализ показывает, что и как представлено и как категории связаны; почему это так — вопрос к другому дизайну исследования.

Тема входит и в программу ЕФВВ по психологии, поэтому студенту стоит держать в голове не только определение Берельсона, но и логику метода: единицы, категории, согласие кодировщиков, границы обобщения.

Мифы и факты о контент-анализе

На самом деле Распространённый миф
Это процедура с правилами, которые можно повторить Контент-анализ — просто внимательное чтение текста
Подход выбирают под вопрос: бывает и количественный, и качественный Метод годится только для подсчёта слов
Частота показывает заметность темы, а не её значимость Чем чаще слово, тем важнее тема
Нужны минимум два независимых кодировщика Хватит одного исследователя, если он добросовестен
Метод описывает содержание и связи, причины проверяет эксперимент Контент-анализ доказывает, что одно вызывает другое
Программа считает слова, а смысл всё равно приписывает человек Машинное кодирование делает анализ объективным

Источники

  • APA Dictionary of Psychology: контент-анализ.
  • Hsieh H.-F., Shannon S. E. Three Approaches to Qualitative Content Analysis. Qualitative Health Research, 2005; 15(9):1277–1288. PubMed
  • Krippendorff K. Reliability in Content Analysis: Some Common Misconceptions and Recommendations. Human Communication Research, 2004; 30(3):411–433. Полный текст
  • Mayring P. Qualitative Content Analysis. Forum Qualitative Sozialforschung, 2000; 1(2), Art. 20. Полный текст
  • Berelson B. Content Analysis in Communication Research. Free Press, 1952.
  • Krippendorff K. Content Analysis: An Introduction to Its Methodology. 4-е изд. SAGE, 2018.
  • Cohen J. A Coefficient of Agreement for Nominal Scales. Educational and Psychological Measurement, 1960; 20(1):37–46. DOI: 10.1177/001316446002000104.
  • Tausczik Y. R., Pennebaker J. W. The Psychological Meaning of Words: LIWC and Computerized Text Analysis Methods. Journal of Language and Social Psychology, 2010; 29(1):24–54. DOI: 10.1177/0261927X09351676.
  • Eichstaedt J. C. и др. Facebook Language Predicts Depression in Medical Records. PNAS, 2018; 115(44):11203–11208. DOI: 10.1073/pnas.1802331115 · PMID: 30322910.

Часто задаваемые вопросы

Что такое контент-анализ простыми словами?

Это способ превратить текст в данные по чётким правилам. Исследователь заранее решает, какие фрагменты текста он рассматривает и какие категории к ним применяет, а затем считает, как категории распределились. От обычного чтения метод отличает то, что правила записаны до анализа, поэтому другой человек может повторить процедуру и получить тот же результат.

Чем контент-анализ отличается от тематического анализа?

Оба метода ищут в тексте темы, но контент-анализ изначально нацелен на систематичность и воспроизводимость: фиксированная кодировочная книга, подсчёт частот, измеряемое согласие кодировщиков. Тематический анализ гибче и допускает достройку категорий по ходу работы, поэтому его результат труднее проверить числом.

Сколько нужно кодировщиков и какое согласие считается достаточным?

Минимум двое, кодирующих независимо и не видящих решений друг друга. Согласие измеряют мерами с поправкой на случайное совпадение — каппой Коэна или альфой Криппендорфа. Практический ориентир: от 0,80 выводы считают надёжными, в интервале около 0,67–0,80 — только предварительными, ниже материал перекодируют.

Можно ли анализировать расшифровки терапевтических сессий?

Да, это один из основных методов исследования процесса терапии, но только с информированного согласия клиента и на полностью обезличенном тексте. Материал хранят отдельно от персональных данных, а объём цитирования в публикации ограничивают. Клинический разбор того же фрагмента ради практики — уже другой формат работы.

Заменяет ли компьютерная программа ручное кодирование?

Нет. Автоматические словари хорошо считают частоты слов, но не улавливают иронию, отрицание и контекст, да и сами категории словаря составлял человек. Поэтому машинную разметку проверяют ручным кодированием на части материала. Как вообще проверяют качество психологических методик, наглядно видно на примере психологических тестов онлайн.

5.0

72 отзыва средняя оценка центра New Leaf

Отзывы в Google