New Leaf — Психологічний центр

Психологический словарь

Психометрия: как измеряют психику — надёжность, валидность, нормы

Методы исследования и психодиагностика

Кратко

Психометрия — раздел психологии, который занимается количественным измерением психических свойств и поведения, а также разработкой, анализом и совершенствованием тестов, опросников и шкал. Проще говоря, она проверяет, можно ли доверять баллу, который выдала методика.

Психометрия

За каждым баллом, который психолог видит в бланке, стоит длинная цепочка допущений: что вопросы подобраны не случайно, что шкала складывается в одно измерение, что результат сопоставим с чьим-то ещё. Психометрия — та часть психологии, которая эту цепочку строит и проверяет. Она отвечает не на вопрос «что с человеком», а на вопрос «можно ли верить цифре, которая у нас получилась». Без такой проверки любая методика остаётся просто списком вопросов с внушительным названием.

Что такое психометрия

Психометрия (англ. psychometrics; в литературе встречается и вариант «психометрика») — раздел психологии, посвящённый количественному измерению психических свойств, поведения и результативности, а также созданию, анализу и совершенствованию инструментов такого измерения: тестов, опросников, шкал. Такое определение даёт словарь Американской психологической ассоциации, и в нём существенны обе части — теория измерения и практическая работа над самими методиками.

Соседнее понятие — психодиагностика, и путают их постоянно. Разница в адресате вопроса. Психодиагностика спрашивает про человека: что с ним происходит, какую методику подобрать под его запрос. Психометрия спрашивает про инструмент: измеряет ли он заявленное и насколько устойчиво. Специалист, который знаком только с первой, вынужден принимать качество своих методик на веру.

Польза от этого знания вполне бытовая. Психометрия даёт язык, на котором объясняется, почему 14 баллов по скрининговой шкале — не «четырнадцать единиц депрессии», а положение относительно нормативной группы, да ещё и с погрешностью. Она же объясняет, почему две методики с почти одинаковым названием дают расходящиеся результаты и почему сырой балл без норм не значит ничего.

Откуда взялась наука об измерении в психологии

Точкой отсчёта принято считать антропометрическую лабораторию, открытую Фрэнсисом Гальтоном в Лондоне в 1884 году: посетитель за небольшую плату проходил серию замеров — рост, сила сжатия, острота зрения, скорость реакции. Гальтона занимали именно различия между людьми, и из этой работы позже выросли идеи корреляции и регрессии к среднему.

Само выражение «умственный тест» пустил в оборот американец Джеймс Маккин Кеттелл — в статье 1890 года в журнале Mind. Его набор проб опирался на те же сенсорные и моторные показатели и именно поэтому оказался тупиковым: проверки начала XX века показали, что скорость реакции почти не связана с учебными достижениями.

Дальше сработали две работы. Чарльз Спирмен в 1904 году обнаружил, что разные интеллектуальные задания положительно связаны между собой, и объяснил это общим источником — фактором g; попутно он предложил способ учесть погрешность измерения, без которого корреляции систематически занижаются. Альфред Бине и Теодор Симон годом позже собрали первую работающую шкалу интеллекта — с заданиями, выстроенными по возрастанию трудности, и понятием умственного возраста.

Оставалось довести формулу до привычного вида. Вильям Штерн предложил делить умственный возраст на хронологический, Льюис Термен — умножать результат на сто; так на свет появился коэффициент интеллекта. Дисциплина окончательно оформилась в 1935 году с учреждением Психометрического общества, а год спустя начал выходить профильный журнал Psychometrika.

Классическая теория тестов: истинный балл и ошибка

Опорная идея классической теории укладывается в одну строку: наблюдаемый балл складывается из истинного балла и случайной ошибки. Истинный балл — вовсе не «правда о человеке», а среднее, которое мы получили бы, повторив измерение бесконечное число раз. Ошибка — вклад усталости, настроения, посторонних звуков, случайно угаданного ответа.

Отсюда выводится надёжность: доля разброса баллов, которая приходится на реальные различия между людьми, а не на шум. Оценивают её несколькими путями — повторным тестированием спустя время, параллельными формами, согласованностью пунктов внутри шкалы, совпадением оценок разных экспертов. Каждый путь улавливает свой тип ошибки, поэтому формулировка «надёжность теста» без уточнения не несёт смысла.

На практике важнее производная величина — стандартная ошибка измерения. Она превращает балл в интервал: если расхождение двух результатов меньше ошибки, обсуждать его не о чем. Представим отбор на программу обучения, где двух кандидатов разделяют три балла по одной и той же шкале. Пока не известна ошибка измерения, эти три балла — не преимущество одного над другим, а иллюзия точности.

Три опоры хорошей методики

Три опоры качественной психологической методики: надёжность, валидность и нормы

Чтобы методику допускали к работе, она обязана выдержать три проверки, и ни одна из них не отменяет двух остальных.

Надёжность отвечает за воспроизводимость. Самую ходовую её оценку — коэффициент альфа, предложенный Ли Кронбахом в 1951 году, — применяют по большей части неверно. Нидерландский психометрист Клас Сейтсма показал, что альфа представляет собой лишь нижнюю границу надёжности, ничего не говорит ни о внутренней согласованности, ни об одномерности шкалы, а привычный порог 0,70 не имеет силы правила. Современные методологи советуют приводить рядом с альфой коэффициент омега.

Валидность отвечает за существо дела: измеряет ли методика именно то, что вынесено в её название. Тест бывает безупречно надёжным и при этом устойчиво измеряет не то. В нынешнем понимании, закреплённом в международных стандартах тестирования, валидность принадлежит не самому тесту, а выводу, который на его основании делают, — и потому обосновывается заново под каждое применение.

Нормы отвечают за сопоставимость. Балл наполняется смыслом только рядом с результатами группы, на которой методика стандартизировалась, поэтому в заключении пишут не сырой балл, а стандартную оценку — процентиль, Т-балл, стен. Нормы к тому же стареют: популяция меняется, и методики приходится время от времени перестандартизировать.

Теория ответа на задание и адаптивное тестирование

У классической теории есть уязвимость: все её показатели привязаны к конкретной выборке и конкретному набору пунктов. Один и тот же пункт в сильной и слабой группе выглядит по-разному, а балл за одну версию теста напрямую не переводится в балл за другую.

Теория ответа на задание обходит это иначе. Она описывает вероятность того или иного ответа на отдельный пункт как функцию от скрытого свойства человека и от параметров самого пункта — трудности, различающей способности, вероятности угадывания. Самая экономная из таких моделей, модель Раша, довольствуется единственным параметром трудности. Выигрыш в том, что человек и задание оказываются на общей шкале, а значит, оценку свойства можно получить из разных наборов пунктов и после сравнивать между собой.

На этом устроено компьютерное адаптивное тестирование: программа подбирает следующее задание под текущую оценку, поскольку слишком лёгкие и слишком трудные пункты почти не добавляют информации. Прежняя точность достигается заметно меньшим числом заданий, а процедура выходит короче и не так утомляет.

Факторный анализ: откуда берутся шкалы

Сколько шкал в действительности содержит опросник, решает не замысел автора, а данные. Факторный анализ отыскивает небольшое число скрытых измерений, которые объясняют, почему определённые группы пунктов получают согласованные ответы.

Линия тянется от Спирмена с его общим фактором через работы Луиса Терстоуна о нескольких первичных умственных способностях к Рэймонду Кеттеллу, выделившему шестнадцать факторов и придавшему личностным опросникам знакомый нам вид. Более поздние исследования на языковом материале свели картину к пяти широким измерениям — модели, на которой держится сегодня большинство методик оценки личности.

Работает анализ в двух режимах. Разведочный спрашивает, какая структура вообще просматривается в данных. Подтверждающий проверяет заранее сформулированную гипотезу о структуре — и нужен ровно тогда, когда методику переносят в новую популяцию.

Адаптация методики на другой язык

Самое частое заблуждение — считать адаптацию теста синонимом перевода. Международная тестовая комиссия, выпускающая руководящие принципы перевода и адаптации методик, описывает эту работу как отдельное исследование: двойной перевод со сверкой обратным переводом, экспертная оценка культурной уместности каждого пункта, сбор данных на местной выборке, проверка факторной структуры и эквивалентности измерения, построение собственных норм.

Возьмём для примера шкалу социальной поддержки. Пункт о том, есть ли кому одолжить крупную сумму денег, в одной культуре отражает близость отношений, в другой — уровень достатка окружения. После дословного перевода он начинает работать на другом участке шкалы, и пока это не проверено, сравнивать результаты с исходными нормами нельзя.

Вывод для практикующего психолога получается короткий: прежде чем брать методику в работу, стоит выяснить, существует ли у неё адаптация с опубликованными данными — или в руках оказался переведённый файл, разошедшийся по профессиональным чатам.

Типичные ошибки психометрии на практике

Громче всего современная критика психологии звучит именно по поводу измерения. Дженнифер Флейк и Эйко Фрид собрали перечень сомнительных измерительных практик: пустить в дело шкалу, не сообщив ни одной её психометрической характеристики; молча выбросить часть пунктов или переделать варианты ответа; составить список вопросов «под это исследование» и назвать его шкалой. Любая из них делает результат непроверяемым.

В повседневной работе промахи выглядят скромнее, а стоят не меньше:

  • Балл без норм. «Клиент набрал 24» не сообщает ровным счётом ничего, пока не сказано, с кем идёт сравнение.
  • Альфа вместо валидности. Высокая согласованность пунктов не доказывает, что шкала измеряет заявленный конструкт.
  • Скрининг вместо диагноза. Опросник отбирает тех, кого стоит расспросить подробнее, а диагноз остаётся делом клинического интервью.
  • Тест без доказательств. Популярные цветовые и «типологические» методики не имеют опубликованных данных о надёжности и валидности, а убедительными кажутся потому, что описывают кого угодно.

Поэтому и выбирать разумно инструменты с открытой психометрической историей: в нашем каталоге психологических тестов у каждой методики указано, на чём она построена и что её результат означает, а чего не означает. Профессиональные стандарты тестирования добавляют требование компетентности: методику применяет тот, кто понимает её ограничения и способен корректно объяснить результат человеку.

Мифы и факты о психометрии

На самом деле Распространённый миф
Надёжность и валидность — разные вещи: тест способен устойчиво измерять не то Устойчивый результат означает, что тест измеряет верно
Балл обретает смысл только в сравнении с нормативной группой Сырой балл сам по себе показывает уровень свойства
Альфа — нижняя граница надёжности, а не доказательство одномерности шкалы Альфа выше 0,70 доказывает, что шкала качественная
Адаптация — самостоятельное исследование с собственными нормами Достаточно аккуратно перевести тест на нужный язык
Психометрия занимается теорией и техникой измерения Психометрия — это «считывание» сведений с предметов руками

Источники

  • APA Dictionary of Psychology: psychometrics (определение психометрии; там же — отдельное значение слова psychometry в парапсихологии, не имеющее подтверждений).
  • Spearman C. "General Intelligence," Objectively Determined and Measured. American Journal of Psychology, 1904, 15, 201-293. Первоисточник
  • Sijtsma K. On the Use, the Misuse, and the Very Limited Usefulness of Cronbach's Alpha. Psychometrika, 2009. DOI: 10.1007/s11336-008-9101-0 · PMID: 20037639 · Полный текст
  • Watson D. Personality Assessment. Noba Project (обзор типов методик оценки личности и их валидности). Открытый учебник
  • Cattell J. M. Mental Tests and Measurements. Mind, 1890, os-XV(59):373-381. DOI: 10.1093/mind/os-XV.59.373
  • Cronbach L. J. Coefficient Alpha and the Internal Structure of Tests. Psychometrika, 1951, 16:297-334. DOI: 10.1007/BF02310555
  • Borsboom D., Mellenbergh G. J., van Heerden J. The Concept of Validity. Psychological Review, 2004, 111(4):1061-1071. DOI: 10.1037/0033-295X.111.4.1061 · PMID: 15482073
  • Flake J. K., Fried E. I. Measurement Schmeasurement: Questionable Measurement Practices and How to Avoid Them. Advances in Methods and Practices in Psychological Science, 2020, 3(4):456-465. DOI: 10.1177/2515245920952393
  • American Educational Research Association, American Psychological Association, National Council on Measurement in Education. Standards for Educational and Psychological Testing. Washington, 2014.
  • International Test Commission. ITC Guidelines for Translating and Adapting Tests (2nd ed.), 2017.

Часто задаваемые вопросы

Что такое психометрия простыми словами?

Это наука о том, как превратить психическое свойство в число и при этом не солгать. Психометрия создаёт тесты и опросники и проверяет их качество по трём критериям: устойчив ли результат (надёжность), измеряет ли методика заявленное (валидность) и есть ли нормы, с которыми балл можно сопоставить.

Чем психометрия отличается от психодиагностики?

Психометрия работает с инструментом, психодиагностика — с человеком. Первая отвечает, годится ли методика вообще и каковы пределы её точности; вторая подбирает методики под конкретный запрос и трактует результат в контексте жизни клиента. Практикующему психологу нужны обе: без психометрии он не отличит проверенную методику от набора вопросов.

Что такое альфа Кронбаха и достаточно ли её для хорошего теста?

Альфа — оценка внутренней согласованности пунктов шкалы, предложенная в 1951 году. Её недостаточно: альфа представляет собой лишь нижнюю границу надёжности, ничего не сообщает об одномерности шкалы и вовсе не касается валидности. Высокая альфа бывает и у шкалы, которая устойчиво измеряет не то, что заявлено.

Почему онлайн-тест не ставит диагноз?

Потому что скрининговая методика показывает лишь вероятность того, что человеку стоит обратиться за помощью, а не устанавливает расстройство. Диагноз выставляют по итогам клинического интервью, анамнеза и критериев классификации, где тест — один из источников данных, а не приговор.

Можно ли просто перевести зарубежный тест на русский или украинский?

Нет. Адаптация — самостоятельное исследование: двойной перевод со сверкой обратным переводом, экспертная оценка культурной уместности пунктов, сбор данных на местной выборке, проверка структуры и построение собственных норм. Переведённый, но не адаптированный опросник нельзя сопоставлять с исходными нормами.

5.0

72 отзыва средняя оценка центра New Leaf

Отзывы в Google