Когда я вижу в интернете очередной опросник с названием «Узнайте свой уровень стресса за 2 минуты», я всегда вспоминаю, сколько работы стоит за по-настоящему работающим тестом. Разница между развлекательным опросником и диагностическим инструментом примерно такая же, как между самодельным плотом и океанским лайнером. Давайте разберёмся, из чего складывается эта разница.

Создание теста — занятие, в котором математика встречается с психологией, а статистика — с искусством задавать правильные вопросы. С одной стороны, это творческий процесс: нужно придумать, как «поймать» неуловимый конструкт вроде выгорания или тревожности. С другой — железная дисциплина: каждый пункт проходит через сито цифр, и большинство первоначальных идей безжалостно отсеивается.

На выходе мы должны получить инструмент, который отвечает нескольким довольно жёстким критериям. Не просто «хороший тест», а конкретно — тест, которому можно доверять.

Тема этой статьи входит в список вопросов для поступления в магистратуру и госэкзамена по специальности «Психология». После изучения вы можете проверить свои знания, пройдя тест.

Пять критериев, без которых тест не работает

Когда психолог говорит «этот тест качественный», он имеет в виду пять вещей. Они звучат суховато, но за каждой стоит реальная проблема, с которой сталкивается разработчик.

Первое — шкала. Тест должен использовать измерительную шкалу не ниже интервальной. За этими словами скрывается простой смысл: расстояние между соседними баллами должно быть одинаковым. Если я отвечаю «2» на вопрос о тревоге, а вы — «4», то разница между нами должна быть такой же, как между «4» и «6». Только при этом условии мы можем честно считать средние баллы и сравнивать группы. Возьмём шкалу Лайкерта из опросника выгорания MBI: «Я чувствую себя эмоционально опустошённым» — варианты от «никогда» до «каждый день». Мы исходим из того, что шаг между «никогда» и «редко» психологически равен шагу между «часто» и «каждый день». Это допущение, но без него невозможна никакая статистика.

Второе — надёжность. Если я прохожу тест сегодня, а через месяц — снова, и получаю совершенно другие баллы, хотя в моей жизни ничего не изменилось, значит, тест «шумит». Шумит так, что за шумом не слышно сигнала. О том, откуда берётся этот шум и как с ним бороться, мы поговорим дальше.

Третье — валидность. Измеряет ли тест именно то, что обещает? Или под видом теста на выгорание нам подсовывают измеритель плохого настроения? С валидностью связана, пожалуй, самая драматичная часть разработки — момент, когда ты показываешь свой тест коллегам, а они говорят: «Слушай, а ведь твои вопросы больше похожи на опросник депрессии».

Четвёртое — дискриминативность заданий. Каждый пункт теста должен уметь отделять «высоких» от «низких». Пункт, с которым соглашаются все подряд, бесполезен — он не различает людей. Представьте вопрос: «Иногда я волнуюсь перед важными событиями». С ним согласятся и очень тревожные, и абсолютно спокойные люди. А вот пункт «Я просыпаюсь по ночам от тревожных мыслей» — тут уже начинается дифференциация. Высокотревожные кивнут, низкотревожные пожмут плечами. Именно такие вопросы и остаются в тесте после всех чисток.

Пятое — нормы. Получить 40 баллов по тесту — это много или мало? Без нормативных данных ответить невозможно. Нормы — это тысячи протестированных людей, разбитых по возрасту, полу, профессии, на фоне которых ваш индивидуальный результат приобретает смысл.

С чего всё начинается: предмет диагностики

Разработка теста стартует не с придумывания вопросов, а с гораздо более скучного, но важного этапа — определения того, что именно мы измеряем. Звучит банально, но именно здесь тонут многие проекты.

Допустим, мы хотим создать тест на выгорание для педагогов. Мало сказать «измеряем выгорание». Нужно дать теоретическое определение: в нашем случае это трёхкомпонентная модель Маслач — эмоциональное истощение, деперсонализация, редукция профессиональных достижений. А затем — операциональное определение: через какие конкретные высказывания человека мы поймём, что у него выгорание? «Я чувствую себя выжатым как лимон», «Мне всё равно, что чувствуют ученики», «Я не вижу смысла в своей работе».

С тревожностью — та же история. Теоретически — это устойчивая склонность воспринимать ситуации как угрожающие (опросник Спилбергера-Ханина). Операционально — человек говорит: «Меня охватывает беспокойство, когда я думаю о своих делах», «Я чувствую напряжение в теле».

С саморегуляцией ориентируемся на модель В.И. Моросановой: способность планировать, моделировать значимые условия, программировать действия и оценивать результаты. Операционально: «Прежде чем начать дело, я продумываю последовательность шагов», «Когда что-то идёт не так, я быстро меняю план».

Самоэффективность (шкала Шварцера) — вера в свою способность справляться с трудными задачами. Операционально: «Я уверен, что смогу найти выход из сложной ситуации», «Когда передо мной встаёт проблема, я знаю, как её решить».

После того как предмет определён, мы выбираем, для кого тест предназначен — в нашем случае для школьных учителей, — и в каких условиях он будет применяться: индивидуально, в группе, онлайн или на бумаге. От этого зависят формулировки и формат.

Первичная версия: рождение и первая чистка

На этом этапе пишется 40–50 первоначальных пунктов. Затем тест даётся небольшой группе — пилотажная выборка. Мы смотрим, какие формулировки вызывают недоумение, какие понимаются неоднозначно, какие вопросы все пропускают. После пилотажа обычно остаётся около 30 пунктов — остальные отсеиваются.

Дальше начинается самое интересное — психометрическая проверка. Здесь разработчик надевает шапку статистика и смотрит на свой тест холодным, беспощадным взглядом.

Первый шаг — анализ пунктов. Для каждого задания вычисляется корреляция с общим баллом. Если пункт слабо связан с итогом, он, скорее всего, измеряет что-то другое. Такие пункты удаляются. Здесь же проверяется дискриминативность: каждый пункт должен разделять людей с высоким и низким уровнем измеряемого качества.

Второй шаг — проверка надёжности. Надёжность в широком смысле отвечает на вопрос: насколько различия между людьми по тесту — это реальные различия в измеряемом свойстве, а не случайные колебания?

Общий разброс результатов складывается из двух частей: Dx = Dист + Dпогр. Первая — истинная дисперсия, то есть то, насколько люди действительно отличаются друг от друга. Вторая — дисперсия погрешности, тот самый «шум», вызванный посторонними причинами: усталостью испытуемого, двусмысленностью формулировок, шумом в помещении, манерой экспериментатора. Коэффициент надёжности — это отношение истинной дисперсии к общей. Если Dист = 85, а Dпогр = 15, то общая дисперсия = 100, а надёжность = 85/100 = 0,85. Это уже можно считать приличным показателем. Если же шум зашкаливает за 40 единиц, надёжность падает до 0,6 — такой тест нужно серьёзно дорабатывать или выбрасывать.

Какой показатель коэффициента надёжности теста считается нормальным и чем это определено?

Коэффициент надёжности варьируется от 0 до 1. Чем ближе к 1, тем меньше доля случайной погрешности в результатах. Ориентиры по уровням:

Коэффициент Оценка Когда применяется
0,90 и выше Отличный Для индивидуальной диагностики, где принимаются важные решения о конкретном человеке (клиническая практика, профотбор)
0,80 – 0,89 Хороший Для большинства исследовательских целей и групповой диагностики
0,70 – 0,79 Приемлемый Для исследовательских опросников на ранних стадиях разработки или при измерении сложных, нестабильных конструктов
ниже 0,70 Недостаточный Тест требует доработки; для принятия индивидуальных решений непригоден

Граница в 0,70 считается минимально допустимой для исследовательских целей, а для практических решений, влияющих на жизнь человека, требуется 0,90 и выше. Это определено стандартами психометрики и зафиксировано в руководствах по тестированию (например, Standards for Educational and Psychological Testing). Более низкий порог для исследований объясняется тем, что там выводы делаются о группах, а не об индивидах, и случайные ошибки усредняются на больших выборках.

Три лица надёжности

Надёжность — понятие многоликое, и проверяют её с разных сторон.

Устойчивость во времени (ретестовая надёжность). Группа педагогов проходит тест на выгорание в июле, затем в августе и декабре. Если тест работает, картина почти не меняется. У условной Марины Ивановны было 42 балла, через месяц — 43, через полгода — 41. У Петра Сергеевича стабильно около 28. Так и должно быть: выгорание — не насморк, за неделю оно не проходит.

Июль
Педагог А: 42
Педагог Б: 28
Педагог В: 35

Август
Педагог А: 43
Педагог Б: 27
Педагог В: 36

Декабрь
Педагог А: 41
Педагог Б: 29
Педагог В: 34

Три замера — примерно одни и те же цифры у одних и тех же людей. Значит, тест надёжен.

Оптимальный интервал для повторного тестирования — около полугода для взрослых и трёх месяцев для детей. При более коротком интервале люди помнят свои ответы и машинально их воспроизводят. При более длинном — могут произойти реальные изменения, и мы примем их за нестабильность теста.

Надёжность параллельных форм. Создаются два равноценных набора заданий — форма А и форма В. Группу делят пополам: первая половина сначала делает А, вторая — В. Через неделю — наоборот. Если корреляция между результатами высока, значит, конкретный набор формулировок не играет решающей роли — тест измеряет именно конструкт, а не особенности конкретных фраз.

Внутренняя согласованность. Тест делят пополам (например, чётные и нечётные пункты) и смотрят, дают ли половинки сходные результаты. Если да — задания работают как единый механизм, все крутятся вокруг одного стержня. Это называют надёжностью по однородности.

Валидность: главный вопрос

Надёжность — это про стабильность. Но стабильно ошибаться — не достижение. Часы, которые всегда показывают на час больше, надёжны, но невалидны. Валидность — это про то, действительно ли тест измеряет то, для чего создан.

Критериальная валидность проверяется через сопоставление результатов теста с реальными жизненными показателями. Например, баллы педагогов по опроснику выгорания MBI сопоставляются с объективными данными — количеством больничных за год. Чем выше выгорание, тем чаще человек болеет. Если корреляция устойчивая, тест валиден.

У критериальной валидности есть два подвида. Текущая валидность — способность теста различать людей по диагностическому признаку прямо сейчас: высокие баллы по шкале тревожности соответствуют наблюдаемому тревожному поведению. Прогностическая валидность — способность предсказывать будущее: педагоги с высокими баллами по тесту выгорания в сентябре с большей вероятностью увольняются к маю. Тест не просто описывает настоящее, но и заглядывает вперёд.

Три характеристики хорошего критерия. Релевантность: критерий должен быть значим для того, что мы измеряем. Количество больничных релевантно для выгорания, а цвет глаз — нет. Свобода от загрязнения: на критерий не должны влиять посторонние факторы. Больничные могут расти не только из-за выгорания, но и из-за эпидемии гриппа — это нужно учитывать. Надёжность критерия: показатель должен быть стабильным, а не плавать в зависимости от того, кто и как его фиксирует.

Конструктная валидность — это проверка того, что тест действительно измеряет теоретический конструкт, а не что-то смежное. Здесь несколько приёмов. Можно сопоставить новый тест на выгорание с уже признанным MBI — если корреляция высока, это аргумент в пользу валидности (конвергентная валидность). Одновременно тест на выгорание не должен сильно коррелировать с тестом на механическую память — это проверка дискриминантной валидности, чтобы убедиться, что мы не измеряем что-то постороннее.

Другой способ — факторный анализ. Он показывает, как пункты теста группируются в факторы. В том же MBI факторный анализ подтверждает именно три шкалы, а не одну или пять. Это и есть факторная валидность — статистическое доказательство того, что структура теста соответствует теоретической модели.

Наконец, можно пойти экспериментальным путём. Если программа профилактики выгорания снижает баллы по тесту, значит, тест чувствителен к изменениям в конструкте. Это серьёзный довод в пользу валидности.

Содержательная валидность — более мягкий, экспертный критерий. Специалисты смотрят на задания и оценивают, все ли аспекты измеряемого явления охвачены. Если тест на саморегуляцию спрашивает только о планировании, но молчит о контроле эмоций — содержательная валидность под вопросом. Эксперты скажут: «Ребята, вы упустили половину конструкта».

Попутно упомяну ещё несколько видов валидности, которые встречаются в литературе. Очевидная валидность — тест выглядит валидным с точки зрения самого испытуемого. Если человеку кажется, что вопросы про погоду, а потом ему объявляют результат про лидерские качества — очевидная валидность низкая, и это может вызвать сопротивление. Экологическая валидность — результаты теста подтверждаются поведением в реальной жизни, а не только в лаборатории. Синтетическая валидность — когда доказательства собираются из множества исследований, каждое из которых подтверждает отдельный аспект.

Финал: нормы и интерпретация

Когда надёжность и валидность подтверждены, тест стандартизируют — собирают данные на большой выборке и рассчитывают нормы. Для педагогов, например, нормы могут различаться в зависимости от стажа: у молодых специалистов свой средний балл, у опытных — свой. Нормы превращают абстрактные баллы в осмысленную информацию. Педагог, набравший 45 баллов, попадает, скажем, в 90-й процентиль — это означает, что только 10% его коллег имеют более высокий уровень выгорания. Повод задуматься.

Первичная форма
Предмет, шкалы,
задания, пилотаж

Психометрика
Анализ пунктов,
надёжность, валидность

Нормы
Стандартизация,
интерпретация

Как проводят стандартизацию и интерпретацию теста?

Стандартизация начинается после того, как надёжность и валидность подтверждены. Процесс состоит из нескольких шагов:

  1. Формирование выборки стандартизации. Это большая, репрезентативная группа (обычно от нескольких сотен до нескольких тысяч человек), отражающая ту популяцию, для которой тест предназначен. Например, если тест создаётся для педагогов, выборка должна включать учителей разного возраста, пола, стажа, из разных регионов и типов школ.

  2. Проведение тестирования. Все участники проходят тест в стандартных, одинаковых условиях — с единой инструкцией, временными ограничениями и процедурой.

  3. Расчёт статистических показателей. Для выборки вычисляются: среднее арифметическое (М), стандартное отклонение (σ), распределение баллов (часто оно должно приближаться к нормальному). Эти данные становятся тестовыми нормами.

  4. Построение нормативных таблиц. Баллы переводятся в стандартные показатели — процентили, стэны, Т-баллы. Например, сырой балл 42 может соответствовать 75-му процентилю, что означает: 75% людей в выборке имеют такой же или более низкий результат.

  5. Разработка правил интерпретации. Создаются диапазоны: «низкий», «средний», «высокий» уровень измеряемого качества. Например, для теста выгорания баллы 0–20 — низкий уровень, 21–35 — средний, 36–54 — высокий. Границы диапазонов обосновываются либо статистически (сигмальные отклонения от среднего), либо экспертно (клинические наблюдения).

  6. Периодический пересмотр норм. Со временем популяционные показатели могут меняться (например, средний уровень тревожности в обществе растёт), поэтому нормы периодически обновляют, проводя повторную стандартизацию на новых выборках.

В результате интерпретация индивидуального результата перестаёт быть гаданием: психолог может обоснованно сказать клиенту не просто «у вас 38 баллов», а «ваш результат выше, чем у 85% людей вашего возраста и профессии, это указывает на повышенный уровень выгорания, требующий внимания».

В сухом остатке: создание теста — это долгий путь, на котором первоначальный энтузиазм («я придумал отличные вопросы!») сменяется смирением перед статистикой, а затем — осторожным удовлетворением, когда цифры подтверждают: инструмент работает. Надёжность страхует от случайных ошибок, валидность — от измерения не того, дискриминативность — от бесполезных вопросов, нормы — от неверной интерпретации. Только пройдя через все эти проверки, опросник перестаёт быть просто списком вопросов и становится тестом, результатам которого можно доверять.

Тема этой статьи входит в список вопросов для поступления в магистратуру и госэкзамена по специальности «Психология». После изучения вы можете проверить свои знания, пройдя тест.