Кратко
Валидность — это степень, в которой данные и теория подтверждают истолкование результатов методики применительно к той цели, ради которой её выбрали. Проще говоря: измеряет ли тест то, что заявляет, и обоснованы ли выводы, которые делают по его баллам.

Любая методика что-то обещает: измерить тревогу, мотивацию, готовность ребёнка к школе. Вот только обещание и результат совпадают далеко не всегда. У вопроса «а что эта шкала измеряет в действительности?» есть в психологии собственное имя — валидность. И вопрос этот сугубо практический: от ответа зависит, вправе ли специалист говорить что-либо о человеке, опираясь на набранные баллы, и не навредит ли такой вывод.
Что такое валидность простыми словами
Валидность (англ. validity) — это степень, в которой имеющиеся данные и теория подтверждают истолкование результатов методики применительно к той цели, ради которой её выбрали. Формулировка выглядит тяжеловесной, но в ней важно каждое слово: валидность не ярлык «хороший тест — плохой тест», она относится к конкретному выводу о конкретных людях в конкретной ситуации.
Именно так понятие трактуют действующие профессиональные стандарты тестирования, принятые совместно американскими ассоциациями образовательных исследований, психологов и специалистов по измерению. В их редакции валидность — единое цельное свойство, а привычные «виды» валидности представляют собой всего лишь разные источники доказательств в её пользу. Ещё в 1995 году Сэмюэл Мессик настаивал, что валидность стоит понимать как интегральное оценочное суждение об обоснованности интерпретации баллов, а вовсе не как набор коэффициентов в техническом описании.
Существует и более радикальная позиция. Группа нидерландских методологов во главе с Денни Борсбумом предложила вернуть понятию предметное содержание: методика валидна тогда, когда измеряемое свойство реально существует, а его изменения причинно влияют на ответы человека. Такой взгляд переносит фокус с таблицы корреляций на механизм: важно не то, с чем связана шкала, а то, почему люди отвечают именно так. Спор двух подходов не закрыт до сих пор и давно вышел за пределы психологии — его разбирают и философы науки в главах о психометрических моделях.
Зачем валидность практикующему психологу
Валидность перестаёт быть академической формальностью в ту минуту, когда специалист подбирает методику под запрос. Один и тот же опросник может годиться для скрининга, подходить для отслеживания динамики в терапии и совершенно не годиться для экспертизы или отбора персонала: под каждую задачу нужны свои доказательства.
Вторая причина — ответственность за вывод. Когда по итогам обследования ребёнку меняют образовательный маршрут, а взрослому рекомендуют консультацию психиатра, основанием служит не известность методики, а накопленные свидетельства того, что баллы действительно связаны с обсуждаемым явлением. Способность предъявить эти свидетельства входит в профессиональную этику и педантизмом не является.
На практике проверка выглядит буднично. В руководстве к методике смотрят, на какой выборке её валидировали, с чем сравнивали баллы, какие показатели получили и для каких решений авторы считают шкалу пригодной. Если всё описание сводится к году создания и обороту «методика широко применяется», доказательств валидности нет — есть традиция употребления, а это совсем другое.
Валидность и надёжность: аналогия с мишенью
Разницу удобнее всего показать через стрельбу. Надёжность — это кучность: стрелы легли рядом, то есть измерение воспроизводится и не зависит от дня, настроения и того, кто его проводит. Валидность — попадание именно в тот круг, в который целились.
Отсюда два следствия, которые постоянно путают. Ненадёжная методика валидной быть не может: если результат скачет от замера к замеру, он не отражает ничего устойчивого. Зато надёжная методика бывает невалидной запросто — кучно, но в чужую мишень. Хрестоматийный случай: опросник, который вместо заявленной черты стабильно и точно улавливает склонность отвечать социально желательно.
Так что надёжность — условие необходимое, но недостаточное. Способы оценить устойчивость результата, ошибку измерения и внутреннюю согласованность шкалы описывает психометрия; оттуда и берутся коэффициенты, которые принято приводить в первом же абзаце описания методики.
Виды валидности
Доказательства валидности группируют по источнику. Различать группы нужно не ради классификации в конспекте, а потому что каждая отвечает на свой вопрос.

Содержательная валидность спрашивает, покрывают ли пункты всю область, которую методика заявляет. Устанавливают её через анализ предметной области и экспертную оценку. Экзамен по общей психологии, собранный из одних только вопросов про даты и фамилии, содержательно невалиден, даже если каждое задание сформулировано безупречно.
Критериальная валидность сопоставляет баллы с внешним показателем. Если показатель измеряют одновременно с тестированием, речь идёт о текущей валидности: результат шкалы депрессии сверяют с заключением клинического интервью в тот же день. Если показатель появится позже — это прогностическая валидность: предскажет ли балл вступительного испытания академическую успеваемость через пару лет. Прогностическая валидность и служит главным аргументом в пользу того, что коэффициент интеллекта вообще что-то значит за пределами самого теста.
Конструктная валидность устроена сложнее прочих, ведь конструкт — тревожность, самоэффективность, перфекционизм — напрямую не наблюдается. Ли Кронбах и Пол Мил в 1955 году предложили проверять его через сеть теоретических предсказаний: с чем свойство обязано быть связано, а с чем связано быть не должно. Так появились две привычные половины: конвергентная валидность (новая шкала тревоги согласуется с признанными шкалами тревоги) и дискриминантная (она же не сливается со шкалой депрессии до неразличимости).
Очевидная валидность стоит особняком: это впечатление испытуемого, что методика выглядит уместной. На готовность отвечать всерьёз оно влияет, поэтому пренебрегать им не стоит, однако доказательством оно не является вовсе. Именно на очевидной валидности держится популярность большинства сомнительных методик.
Как валидность доказывают: история одной шкалы депрессии
Отвлечённое определение укладывается в голове через конкретную историю валидации. Девятипунктовая шкала депрессии опросника здоровья пациента сделалась мировым стандартом скрининга не благодаря краткости, а потому что её проверяли сразу с нескольких сторон.
В работе Курта Кроенке, Роберта Спитцера и Дженет Уильямс 2001 года шкалу заполнили шесть тысяч пациентов в восьми клиниках первичного звена и семи акушерско-гинекологических. Критериальную валидность проверяли на подвыборке из 580 человек: баллы сравнивали с независимым структурированным интервью специалиста по психическому здоровью. При пороге в 10 баллов и выше чувствительность и специфичность в отношении большого депрессивного расстройства составили по 88 процентов.
Конструктную валидность подтверждали иначе: по мере роста баллов последовательно ухудшалось функциональное состояние по всем шкалам опросника здоровья, увеличивалось число дней нетрудоспособности и обращений за медицинской помощью — шкала вела себя ровно так, как положено мере тяжести депрессии. За этот набор доказательств тест на депрессию PHQ-9 и называют валидированным инструментом. По той же причине он остаётся скринингом, а не диагнозом: 12 процентов пропущенных случаев на пороге в 10 баллов означают, что последнее слово всегда за клиническим интервью.
Тот же путь проходит любая новая методика. Представим исследовательницу, которая собирает короткий опросник учебной мотивации первокурсников. Сначала она описывает, из чего складывается явление, и просит нескольких преподавателей проверить, не выпало ли что-то существенное, — это работа на содержательную валидность. Затем даёт свой опросник вместе с признанной методикой мотивации и вместе со шкалой добросовестности: совпадение с первой должно быть заметным, со второй — намного скромнее, иначе новая шкала измеряет черту характера, а не мотивацию. Дальше остаётся дождаться сессии и посмотреть, отличаются ли по результатам те, кто набрал высокие баллы. И только после этого автор вправе указать, что баллы пригодны для оценки учебной мотивации студентов первого курса — и пока лишь для неё.
Внутренняя и внешняя валидность исследования
Слово «валидность» применяют и к исследованию целиком, и это уже другой, хотя и родственный разговор. Ещё в 1957 году Дональд Кэмпбелл развёл два вопроса: точно ли изменение вызвано вмешательством и работает ли вывод за пределами данного исследования.
Внутренняя валидность отвечает за первое. Ей угрожают посторонние события, случившиеся параллельно с экспериментом, естественное взросление участников, отсев тех, кому пришлось тяжелее всех, эффект повторного тестирования и регрессия к среднему, из-за которой самые низкие исходные показатели улучшаются сами собой при втором замере. Контрольная группа и случайное распределение участников затем и нужны, чтобы отсечь эти альтернативные объяснения.
Внешняя валидность отвечает за второе: переносится ли результат на других людей, другие условия и другое время. Безупречно контролируемый эксперимент на тридцати студентах-психологах, пришедших ради дополнительных баллов, вполне может обладать высокой внутренней и весьма скромной внешней валидностью. Всё упирается в репрезентативность выборки, и между двумя видами валидности почти всегда приходится искать компромисс: чем жёстче лабораторный контроль, тем меньше ситуация похожа на жизнь.
Типичные ошибки и почему «тест из соцсетей» ничего не измеряет
Самая частая ошибка — судить о методике по впечатлению от неё. Обобщённые формулировки подходят почти каждому, и узнавание себя читатель принимает за точность измерения. Ровно эта ловушка делает персональным гороскоп: субъективная убедительность валидностью не является. На ней держится, в частности, тест Люшера, популярность которого намного старше попыток его проверить.
Вторая ошибка — самодельные шкалы. Дженнифер Флейк и Эйко Фрид в 2020 году показали, что в психологических публикациях сплошь и рядом не сообщается элементарное: откуда взята шкала, меняли ли в ней пункты, есть ли хоть какие-то доказательства валидности. Исследователи назвали это сомнительными практиками измерения: вопросы формулируют под себя, а корреляции считают так, будто инструмент проверен.
Третья — доверие к названию. Две шкалы с одинаковым именем способны измерять разное, а две с разными именами — одно и то же. Смотреть нужно на пункты и на доказательства, а не на обложку.
Четвёртая — перенос без адаптации: переведённый опросник не наследует валидность оригинала автоматически, нужны новая выборка, новые нормы и новые доказательства. И последняя: валидность не выдают пожизненно. Изменилась популяция, цель применения или процедура — требуются свежие свидетельства. Тем, кто готовится к ЕФВВ по психологии, эта логика приносит больше всего баллов: спрашивают почти всегда о том, какое доказательство нужно для какого вывода.
На самом деле и распространённые мифы
Что о валидности говорят чаще всего — и как обстоит дело:
| На самом деле | Распространённый миф |
|---|---|
| Валидность относится к истолкованию баллов под конкретную цель | Валидность — врождённое свойство самого теста |
| Надёжная методика способна стабильно измерять совсем не то | Стабильный результат означает, что тест валиден |
| Правдоподобный вид вопросов ничего не доказывает | Раз вопросы выглядят уместно, тест работает |
| Доказательства накапливаются и нуждаются в обновлении | Тест валидировали один раз — и навсегда |
| Валидированный скрининг лишь сортирует, диагноз ставит специалист | Валидированный тест может поставить диагноз |
| Перевод требует новой выборки, норм и проверки | Переведённая методика остаётся валидной |
Источники
- APA Dictionary of Psychology: validity (определение валидности и её разновидностей).
- American Educational Research Association, American Psychological Association, National Council on Measurement in Education. Standards for Educational and Psychological Testing. AERA, 2014. (валидность как единое свойство; источники доказательств)
- Cronbach L. J., Meehl P. E. Construct validity in psychological tests. Psychological Bulletin, 1955; 52(4):281–302. PMID: 13245896.
- Messick S. Validity of psychological assessment. American Psychologist, 1995; 50(9):741–749. DOI: 10.1037/0003-066X.50.9.741.
- Borsboom D., Mellenbergh G. J., van Heerden J. The concept of validity. Psychological Review, 2004; 111(4):1061–1071. DOI: 10.1037/0033-295X.111.4.1061 · PMID: 15482073.
- Kroenke K., Spitzer R. L., Williams J. B. W. The PHQ-9: validity of a brief depression severity measure. Journal of General Internal Medicine, 2001; 16(9):606–613. Полный текст
- Campbell D. T. Factors relevant to the validity of experiments in social settings. Psychological Bulletin, 1957; 54(4):297–312. DOI: 10.1037/h0040950.
- Flake J. K., Fried E. I. Measurement Schmeasurement: Questionable Measurement Practices and How to Avoid Them. Advances in Methods and Practices in Psychological Science, 2020; 3(4):456–465. DOI: 10.1177/2515245920952393.
- Tal E. Measurement in Science (раздел о психометрических моделях и конструктной валидности). Stanford Encyclopedia of Philosophy, 2020.
Часто задаваемые вопросы
Что такое валидность простыми словами?
Это ответ на вопрос, измеряет ли методика именно то, что заявляет, и можно ли по её баллам сделать тот вывод, ради которого проводилось тестирование. Валидность относится не к тесту вообще, а к конкретному применению: одна и та же шкала бывает пригодна для скрининга и непригодна для экспертизы.
Чем валидность отличается от надёжности?
Надёжность — это воспроизводимость: повторный замер даёт примерно то же самое. Валидность — попадание именно в то свойство, которое собирались измерить. Ненадёжная методика валидной быть не может, а надёжная невалидной бывает запросто: она стабильно и точно измеряет вовсе не то, что обещает.
Какие бывают виды валидности?
Содержательная показывает, покрывают ли пункты всю заявленную область; критериальная — совпадает ли балл с внешним показателем сегодня или в будущем; конструктная — ведёт ли себя шкала так, как положено мере этого свойства. Особняком стоит очевидная валидность: методика выглядит уместной, но само по себе это ничего не доказывает.
Можно ли доверять онлайн-тестам?
Зависит от того, что за ними стоит. Валидированные шкалы дают полезный скрининговый ориентир, а развлекательные «тесты на тип личности» не измеряют ничего. Даже валидированная методика диагноз не ставит: её результат — повод поговорить со специалистом. Проверенные инструменты собраны в разделе психологических тестов.
Как проверить валидность нового опросника?
Сначала согласовать содержание пунктов с экспертами, затем показать, что баллы заметно связаны с признанными мерами того же свойства и намного слабее — с мерами соседних, и наконец проверить, предсказывают ли они практически важный результат. Каждый шаг делается на своей выборке, а вывод формулируют только для той популяции, на которой проверяли.
72 отзыва — средняя оценка центра New Leaf