Тесты и шкалы · глава 1 из 14
Глава 1

Откуда берутся тесты

Тест выглядит как измерительный прибор: ответили на вопросы — получили цифру. Но у каждой настоящей шкалы есть история: кто её придумал, для чего и как проверял. Если её знать, становится понятно сразу многое — и почему короткий проверенный опросник надёжнее длинного из интернета, и почему переведённый энтузиастами тест уже не равен оригиналу.

Начнём с неожиданного: первый в мире опросник придумали не для того, чтобы кому-то помочь.

Первый опросник придумали, чтобы отсеивать

1917 год, США вступают в Первую мировую. Армии нужно быстро понимать, кто из призывников не выдержит фронта — тогда это называли «снарядным шоком». Разговаривать с каждым некогда, психиатров на всех не хватает.

Тогда психолог, работавший на армию, составляет список из 117 вопросов с ответами «да» и «нет» — про страхи, навязчивые мысли, телесные жалобы, сны. Так появляется первый стандартизированный опросник в психологии.

Стоит задержаться на том, зачем он был нужен. Не чтобы человек разобрался в себе и не чтобы ему стало легче — а чтобы отобрать подходящих и отсеять остальных. Инструмент с самого рождения был про сортировку, а не про заботу. Это свойство никуда не делось: шкала и сегодня отвечает на вопрос «похоже или не похоже», а не на вопрос «что со мной и как мне быть».

Как вопрос попадает в шкалу

Тогда же придумали способ проверять, годится вопрос для шкалы или нет. Он простой, и им пользуются до сих пор.

Один и тот же вопрос задают двум группам: людям, у которых состояние уже определено врачом, и всем остальным. Дальше смотрят на разницу в ответах. Если обе группы отвечают примерно одинаково — вопрос выбрасывают, каким бы правильным по смыслу он ни казался. Оставляют только те вопросы, где разница получилась заметной.

На примере видно, почему так. Возьмём вопрос «бывает ли, что вы волнуетесь перед важным разговором». По теме — прекрасный. Для шкалы — бесполезный: «да» ответят почти все, и разделить по нему людей невозможно. А вот вопрос «бывает ли, что тревога не отпускает неделями и мешает работать» здоровые отмечают редко — и он уже работает.

Отсюда главное отличие настоящей шкалы от развлекательной: вопрос нужен не для того, чтобы звучать по теме, а для того, чтобы различать. В тесте из ленты вопросы подобраны на слух — красиво, узнаваемо и совершенно неизвестно, показывают ли они хоть что-нибудь.

И это объясняет, почему длина ничего не значит: тест может состоять из шестисот пунктов, но если их никто не проверял на различение, точности они не добавят — только времени на прохождение.

Шкалы придумывали для тех, у кого диагноз уже есть

Дальше две даты, которые объясняют, почему шкалы устроены именно так.

1960 год, шкала Гамильтона. Её заполняет врач, и создавалась она, чтобы измерять выраженность депрессии у людей, которым диагноз уже поставлен — например, чтобы видеть, помогает ли лечение.

1961 год, шкала Бека. Поворот: впервые оценку даёт сам человек, а не наблюдатель. Двадцать один пункт, ответы от нуля до трёх.

Обе шкалы — про измерение того, что уже известно. Не про поиск, не про ответ на вопрос «что со мной». Линейка, а не карта. Когда шкала попадает в интернет и начинает работать инструментом поиска диагноза — она используется не по назначению, и отсюда почти все проблемы.

Откуда берётся проходной балл

Современная шкала проходит долгий путь, прежде чем ею начинают пользоваться. Сначала определяют, что именно измеряют. Потом собирают пул вопросов — из научных работ, от специалистов, от самих пациентов. Дальше проверяют, что шкала устойчива: пункты согласуются между собой, а повтор через время даёт похожий результат. Потом сверяют её с разговором с врачом как с эталоном.

И только в самом конце считают порог: при каком значении баланс ошибок получается лучшим.

Вот это стоит запомнить крепче всего: порог задаёт компромисс между двумя видами ошибок, а не границу между здоровьем и болезнью. Его выбирают так, чтобы шкала пропускала не слишком много тех, кому плохо, и не слишком часто тревожила тех, у кого всё в порядке. Сдвинуть его на балл вниз — вырастет число ложных тревог. На балл вверх — вырастет число пропущенных. Идеальной точки не существует, поэтому выбирают терпимую.

Что это значит для вас

Цифра, которую вы получили, — это не «сколько во мне болезни». Это ответ на вопрос: «попадает ли то, что человек про себя отметил, в ту зону, где чаще оказываются люди с диагнозом».

Почему перевод — это не перевод

Отдельная история — как шкала попадает в другой язык. Кажется, что достаточно аккуратно перевести вопросы. На самом деле есть международный стандарт, и он выглядит так:

  1. Два независимых перевода на новый язык — чтобы поймать расхождения.
  2. Их сведение в один согласованный вариант.
  3. Два обратных перевода назад на язык оригинала, которые делают люди, не видевшие исходный текст.
  4. Экспертная комиссия сверяет смысл каждого пункта, а не слова: одинаково ли он понимается.
  5. Проверка на живых людях из той группы, для которой шкала предназначена.
  6. И заново вся психометрическая проверка — уже на новом языке.

Последний шаг не формальность. Порог для страны вполне может оказаться другим, потому что тяжёлое состояние в разных культурах описывают по-разному: где-то чаще говорят про тело — не спится, давит в груди, а где-то про чувства. Один и тот же вопрос в двух языках может ловить разное.

Поэтому любительский перевод — это не тот же тест на русском. В нём пропущено пять этапов из шести и вся повторная проверка. Вопросы могут выглядеть знакомо, а вот числа под ними уже ничего не значат.

Так устроен, например, тест на аутизм у взрослых: официальной русской версии RAADS-R не существует, а по сайтам ходят переводы энтузиастов. Подробнее — в главе «Тест на аутизм у взрослых».

Баллы не нужны, чтобы вам помогли. Всё это устройство полезно понимать, но оно ничего не меняет в главном: если то, что с вами происходит, мешает жить — этого достаточно, чтобы разбираться и обращаться за помощью. Не нужно ни набирать проходной балл, ни разбираться в психометрии.

Список источников
  • Клинические рекомендации «Депрессивный эпизод, рекуррентное депрессивное расстройство». Российское общество психиатров, одобрены Минздравом России, 2024 (рубрикатор cr.minzdrav.gov.ru). Психометрические шкалы — HDRS, MADRS, HADS, PHQ-9 — названы инструментом объективизации и определения степени тяжести состояния; скрининг отнесён к первичной диагностике и не является определяющим при выборе тактики лечения.
  • Клинические рекомендации «Биполярное аффективное расстройство». Российское общество психиатров, одобрены Научно-практическим советом Минздрава России, 2025 (ID рубрикатора 675; редакция 2021 г. архивирована). Диагноз устанавливается по результатам психиатрического осмотра; в спектр включены БАР I, БАР II и циклотимия.
  • Клинические рекомендации «Тревожно-фобические расстройства». Российское общество психиатров, одобрены Минздравом России, 2024 (диагностика тревожных расстройств как клиническая задача врача).
  • Клинические рекомендации «Обсессивно-компульсивное расстройство». Российское общество психиатров, одобрены Минздравом России, 2025 (обновление рекомендаций 2021 г.; Y-BOCS применяется как клиническая шкала оценки тяжести).
  • Клинические рекомендации «Шизофрения». Российское общество психиатров, одобрены Минздравом России, 2024 (диагноз устанавливает врач-психиатр по результатам клинического обследования и наблюдения — самоопросника для этой группы расстройств не предусмотрено).
  • Клинические рекомендации «Расстройства аутистического спектра». Одобрены Научно-практическим советом Минздрава России, 2024 (диагностика РАС — клиническая, с опорой на историю раннего развития).
  • Клинические рекомендации «Специфические расстройства личности». Российское общество психиатров и НМИЦ психиатрии и наркологии им. В.П. Сербского, одобрены Минздравом России, 2024 (пограничное расстройство личности как F60.31; диагностика расстройств личности требует оценки в динамике).
  • Ханин Ю.Л. Краткое руководство к применению шкалы реактивной и личностной тревожности Ч.Д. Спилбергера. Л.: ЛНИИФК; 1976 (русская адаптация STAI; разделение тревоги как состояния и тревоги как устойчивой черты).
  • Woodworth R.S. Personal Data Sheet. Chicago: Stoelting; 1917 (первый стандартизированный опросник в психологии; создавался для отбора призывников. Принцип отбора пунктов: оставляли только вопросы, на которые люди с уже поставленным диагнозом отвечали заметно чаще, и убирали те, что отмечала четверть здоровых).
  • Hamilton M. A rating scale for depression. Journal of Neurology, Neurosurgery and Psychiatry. 1960;23(1):56–62 (шкала заполняется врачом и измеряет выраженность состояния у людей с уже установленным диагнозом, а не ищет болезнь).
  • Beck AT, Ward CH, Mendelson M, Mock J, Erbaugh J. An inventory for measuring depression. Archives of General Psychiatry. 1961;4:561–571 (первая шкала, где оценку даёт сам человек, а не наблюдатель).
  • Beaton DE, Bombardier C, Guillemin F, Ferraz MB. Guidelines for the process of cross-cultural adaptation of self-report measures. Spine. 2000;25(24):3186–3191 (международный стандарт адаптации опросника на другой язык: два независимых перевода, синтез, два обратных перевода, экспертная комиссия, полевое тестирование — и повторная психометрическая проверка на новом языке).
  • Wild D, Grove A, Martin M, et al. Principles of good practice for the translation and cultural adaptation process for patient-reported outcomes (PRO) measures: report of the ISPOR Task Force. Value in Health. 2005;8(2):94–104 (дополняющий стандарт перевода и культурной адаптации опросников).
  • Caspi A, Houts RM, Belsky DW, et al. The p factor: one general psychopathology factor in the structure of psychiatric disorders? Clinical Psychological Science. 2014;2(2):119–137 (структура психических расстройств хорошо описывается одним общим фактором; связь с ним высокая у депрессивного эпизода, генерализованной тревоги и СДВГ — поэтому несколько шкал могут «загореться» одновременно).
  • Andrade LH, Alonso J, Mneimneh Z, et al. Barriers to mental health treatment: results from the WHO World Mental Health surveys. Psychological Medicine. 2014;44(6):1303–1317 (опросы в 24 странах: ощущение «мне не настолько плохо» — самая частая причина не начинать лечение, и встречается чаще при лёгких и умеренных состояниях, чем при тяжёлых; среди признавших потребность в помощи 63,8% хотели справиться самостоятельно).
  • World Health Organization. ICD-11 for Mortality and Morbidity Statistics. Geneva: WHO (действующая международная классификация; диагностические категории, на которых построены шкалы).
  • American Psychiatric Association. Diagnostic and Statistical Manual of Mental Disorders, 5th ed., Text Revision (DSM-5-TR). Washington, DC: APA; 2022 (критерии, по которым построены PCL-5 и ряд других опросников).
  • Kroenke K, Spitzer RL, Williams JB. The PHQ-9: validity of a brief depression severity measure. Journal of General Internal Medicine. 2001;16(9):606–613 (первоисточник PHQ-9: 9 пунктов по критериям депрессии, диапазон 0–27; проверялся на 6000 пациентов).
  • Levis B, Benedetti A, Thombs BD; DEPRESSD Collaboration. Accuracy of Patient Health Questionnaire-9 (PHQ-9) for screening to detect major depression: individual participant data meta-analysis. BMJ. 2019;365:l1476 (58 исследований, 17 357 участников; при пороге 10 и выше чувствительность 0,88, специфичность 0,85 — то есть примерно каждый восьмой случай депрессии шкалой пропускается).
  • Negeri ZF, Levis B, Sun Y, et al. Accuracy of the Patient Health Questionnaire-9 for screening to detect major depression: updated systematic review and individual participant data meta-analysis. BMJ. 2021;375:n2183 (обновление предыдущего мета-анализа — самые свежие сводные данные по точности PHQ-9).
  • Beck AT, Steer RA, Brown GK. Manual for the Beck Depression Inventory-II. San Antonio: Psychological Corporation; 1996 (актуальная редакция шкалы Бека; оригинал — 1961 г. Опросник охраняется авторским правом и распространяется правообладателем платно, поэтому бесплатные онлайн-версии, как правило, неофициальны).
  • Spitzer RL, Kroenke K, Williams JBW, Löwe B. A brief measure for assessing generalized anxiety disorder: the GAD-7. Archives of Internal Medicine. 2006;166(10):1092–1097 (первоисточник GAD-7: 7 пунктов, диапазон 0–21, ориентир 10 и выше).
  • Plummer F, Manea L, Trepel D, McMillan D. Screening for anxiety disorders with the GAD-7 and GAD-2: a systematic review and diagnostic metaanalysis. General Hospital Psychiatry. 2016;39:24–31 (12 выборок, 5223 участника; при пороге 10 чувствительность 83%, специфичность 84%).
  • Hirschfeld RMA, Williams JBW, Spitzer RL, et al. Development and validation of a screening instrument for bipolar spectrum disorder: the Mood Disorder Questionnaire. American Journal of Psychiatry. 2000;157(11):1873–1875 (первоисточник MDQ; положительным результат считается при 7 и более симптомах, которые были одновременно и создавали трудности).
  • Wang HR, Woo YS, Ahn HS, et al. The validity of the Mood Disorder Questionnaire for screening bipolar disorder: a meta-analysis. Depression and Anxiety. 2015;32(7):527–538 (21 исследование; при пороге 7 сводная чувствительность 0,62, а среди людей без ранее известного биполярного диагноза — 0,37, то есть в обычной ситуации скрининг пропускает большинство случаев; хуже всего распознаётся БАР II).
  • Angst J, Adolfsson R, Benazzi F, et al. The HCL-32: towards a self-assessment tool for hypomanic symptoms in outpatients. Journal of Affective Disorders. 2005;88(2):217–233 (первоисточник опросника гипомании; инструмент создан именно потому, что подъёмы человек сам за проблему не считает и врачу о них не рассказывает).
  • Kessler RC, Adler L, Ames M, et al. The World Health Organization Adult ADHD Self-Report Scale (ASRS): a short screening scale for use in the general population. Psychological Medicine. 2005;35(2):245–256 (первоисточник ASRS; Часть A из 6 пунктов, положительный скрининг — 4 и более отметки в затемнённых полях; высокая специфичность при умеренной чувствительности).
  • Goodman WK, Price LH, Rasmussen SA, et al. The Yale-Brown Obsessive Compulsive Scale. I. Development, use, and reliability. Archives of General Psychiatry. 1989;46(11):1006–1011 (первоисточник Y-BOCS: 10 пунктов, диапазон 0–40; шкала изначально задумана как заполняемая клиницистом в формате интервью, а не самостоятельно).
  • Storch EA, Rasmussen SA, Price LH, et al. Development and psychometric evaluation of the Yale-Brown Obsessive-Compulsive Scale — Second Edition. Psychological Assessment. 2010;22(2):223–232 (вторая редакция шкалы; избегание учтено в оценке тяжести).
  • Zanarini MC, Vujanovic AA, Parachini EA, et al. A screening measure for BPD: the McLean Screening Instrument for Borderline Personality Disorder (MSI-BPD). Journal of Personality Disorders. 2003;17(6):568–573 (первоисточник MSI-BPD: 10 вопросов, порог 7; инструмент заявлен авторами именно как скрининг, а не как диагностический).
  • Blevins CA, Weathers FW, Davis MT, Witte TK, Domino JL. The Posttraumatic Stress Disorder Checklist for DSM-5 (PCL-5): development and initial psychometric evaluation. Journal of Traumatic Stress. 2015;28(6):489–498 (первоисточник PCL-5: 20 пунктов по 20 симптомам, диапазон 0–80).
  • Cloitre M, Shevlin M, Brewin CR, et al. The International Trauma Questionnaire: development of a self-report measure of ICD-11 PTSD and complex PTSD. Acta Psychiatrica Scandinavica. 2018;138(6):536–546 (первоисточник ITQ; разделяет обычное и комплексное ПТСР по критериям МКБ-11).
  • Morgan JF, Reid F, Lacey JH. The SCOFF questionnaire: assessment of a new screening tool for eating disorders. BMJ. 1999;319(7223):1467–1468 (первоисточник SCOFF: 5 вопросов, ориентир — 2 и более утвердительных ответа).
  • Kutz AM, Marsh AG, Gunderson CG, Maguen S, Masheb RM. Eating disorder screening: a systematic review and meta-analysis of diagnostic test characteristics of the SCOFF. Journal of General Internal Medicine. 2020;35(3):885–893 (сводная чувствительность 0,86, специфичность 0,83 — при том, что инструмент опирается на самоотчёт).
  • Garner DM, Olmsted MP, Bohr Y, Garfinkel PE. The Eating Attitudes Test: psychometric features and clinical correlates. Psychological Medicine. 1982;12(4):871–878 (первоисточник EAT-26; ориентир — 20 баллов и выше как повод для дальнейшей оценки).
  • Maslach C, Jackson SE. The measurement of experienced burnout. Journal of Occupational Behaviour. 1981;2(2):99–113 (первоисточник MBI; создавался как исследовательский и организационный инструмент, распространяется правообладателем по лицензии — не как бытовой самотест).
  • Ritvo RA, Ritvo ER, Guthrie D, et al. The Ritvo Autism Asperger Diagnostic Scale-Revised (RAADS-R): a scale to assist the diagnosis of autism spectrum disorder in adults. Journal of Autism and Developmental Disorders. 2011;41(8):1076–1089 (первоисточник RAADS-R: 80 утверждений, порог 65; в оригинальной работе опросник заполнялся вместе с клиницистом).
  • Sizoo BB, Horwitz EH, Teunisse JP, et al. Predictive validity of self-report questionnaires in the assessment of autism spectrum disorders in adults. Autism. 2015;19(7):842–849 (у пациентов психиатрической клиники без аутизма средний балл RAADS-R оказался существенно выше исходного порога — то есть высокий результат сам по себе аутизм не означает).
  • Jones SL, Johnson M, Alty B, Adamou M. The effectiveness of RAADS-R as a screening tool for adult ASD populations. Autism Research and Treatment. 2021;2021:9974791 (при самостоятельном заполнении специфичность около 3%: почти все обследованные набирали выше порога независимо от итогового диагноза).
  • Hull L, Mandy W, Lai MC, et al. Development and validation of the Camouflaging Autistic Traits Questionnaire (CAT-Q). Journal of Autism and Developmental Disorders. 2019;49(3):819–833 (первоисточник CAT-Q: 25 пунктов; измеряет усилия по маскировке, диагностического порога не имеет).

Статья опирается только на научные и клинические источники — исследования, мета-анализы, официальные клинические рекомендации ВОЗ, Минздрава РФ, APA, NICE. Ничего из неподтверждённых исследований, непроверенных блогов и личных мнений тут нет.