Выборка стандартизации. При разработке и применении любой точки отсчета следует обращать особое внимание на выборку испытуемых, на которой проводится стандартизация диагностической методики. В математической статистике принято различать такие понятия, как генеральная совокупность (популяция) и выборка.
Всякая большая совокупность людей, которую хотели бы исследовать или относительно которых собираются делать выводы, называется генеральной совокупностью.
Выборка — это часть или подмножество совокупности. Проводить исследование всей популяции не принято. Обычно из нее выделяют группу людей — выборку стандартизации — которая реально подвергается тестированию, и с ее помощью оценивается генеральная совокупность. Чтобы оценки носили достоверный характер, выборка должна быть репрезентативна, представительна рассматриваемой популяции, т. е. ее вероятностные свойства должны совпадать или быть близкими к свойствам генеральной совокупности.
А. Анастази [10, т. 1] приводится пример формирования репрезентативной выборки при стандартизации шкалы Векслера. Выборка включала 1700 человек с равным количеством мужчин и женщин. Испытуемые в возрасте от 16 до 64 лет были распределены по семи возрастным уровням. При формировании выборки исследователи опирались на данные последней переписи населения США. Учитывалось пропорциональное распределение населения по географическим районам, принадлежность к городскому и сельскому населению, принадлежность к белой или цветной расе, учитывались также уровень образования и профессия. На каждом возрастном уровне в выборку были введены один мужчина и одна женщина, находящиеся в учреждениях для умственно отсталых.
По мнению А. Анастази, подавляющее большинство диагностических методик стандартизовано не для столь широких популяций, как многие полагают. Трудно рассчитывать, что по какому-либо тесту имеются адекватные нормы для таких обширных популяций, как, например, «взрослые американцы-мужчины» или «американские дети 14-летнего возраста». Выборки, ориентированные на широкие популяции, не всегда репрезентативны и чаще всего бывают смещены в тех или иных отношениях (т. е. некоторые подгруппы популяции могут быть представлены непропорционально своей численности). Так, если определить популяцию как «14-летние дети», а выборку стандартизации составить из 14-летних школьников, то ее нельзя рассматривать в качестве репрезентативной, поскольку не все 14-летние дети являются школьниками. В этом случае лучше сузить определение популяции (т. е. определить ее как «14-летние школьники»), чем переносить нормы, полученные на школьниках, на популяцию 14-летних детей.
Таким образом, одним из способов обеспечения репрезентативности выборки является ограничение популяции. Ограничить популяцию можно по разным признакам: по возрасту, полу, социальному происхождению, профессии, социально-экономическому статусу, здоровью и т. д. Такая популяция определяется как специфическая, и стандартизация диагностических методик осуществляется на узконаправленных выборках, которые репрезентативны специфической популяции. Создатель диагностической методики должен всегда сообщать, для какой специфической популяции были разработаны нормативные показатели.
Отбор испытуемых в выборку стандартизации осуществляется следующим образом:
1) дается определение популяции с выделением в ее структуре переменных, значимых и малозначимых для изучаемого психического явления (возраст, образование, профессия и т. д.);
2) популяция делится на части в соответствии со значимыми переменными;
3) испытуемые отбираются в случайном порядке и пропорционально численности каждой значимой части совокупности. Случайный отбор может осуществляться по алфавиту, по таблице случайных чисел или другим способом. Важно, чтобы у всех представителей популяции были равные шансы попасть в выборку стандартизации. Это условие подразумевает, что каждый выбор не зависит от остальных.
Объем выборки может варьироваться в широких пределах, но ее минимальный порог, необходимый для получения достоверных результатов, — порядка 200 человек [26].
§ 2. Надежность и валидность
Прежде чем психодиагностические методики могут быть использованы для практических целей, они должны пройти проверку по ряду формальных критериев, доказывающих их высокое качество и эффективность. Эти требования в психодиагностике складывались годами в процессе работы над тестами и над их совершенствованием. В результате появилась возможность оградить психологию от всевозможных безграмотных подделок, претендующих на то, чтобы называться диагностическими методиками.
К числу основных критериев оценки психодиагностических методик относятся надежность и валидность. Большой вклад в разработку этих понятий внесли зарубежные психологи (А. Анастази, Е. Гизелли, Дж. Гилфорд, Л. Кронбах, Р. Торндайк и Е. Хаген и др.). Ими были разработаны как формально-логический, так и математико-статисти-ческий аппарат (прежде всего, корреляционный метод и факторный анализ) обоснования степени соответствия методик отмеченным критериям.
В психодиагностике проблемы надежности и валидности методик тесно взаимосвязаны, тем не менее существует традиция раздельного изложения этих важнейших характеристик. Следуя ей, начнем с рассмотрения надежности методик.
Надежность
В традиционной тестологии термин «надежность» означает относительное постоянство, устойчивость, согласованность результатов теста при первичном и повторном его применении на одних и тех же испытуемых. Как пишет А. Анастази [ 10, т. 1 ], вряд ли можно с доверием относиться к тесту интеллекта, если по нему в начале недели ребенок имел показатель, равный 110, а к концу — 80. Повторное применение надежных методик дает сходные оценки. При этом в определенной мере могут совпадать как сами результаты, так и порядковое место (ранг), занимаемое испытуемым в группе. И в том, и в другом случае при повторении опыта возможны некоторые расхождения, но важно, чтобы они были незначительными, в пределах одной группы. Таким образом, можно сказать, что надежность методики — это такой критерий, который говорит о точности психологических измерений, т. е. позволяет судить о том, насколько внушают доверие полученные результаты.
Степень надежности методик зависит от многих причин. Поэтому важной проблемой практической диагностики является выяснение факторов, снижающих точность измерений. Была сделана попытка составить классификацию таких факторов. Среди них наиболее часто называются следующие:
1) нестабильность диагностируемого свойства;
2) несовершенство диагностических методик (небрежно составлена инструкция, задания по своему характеру разнородны, нечетко сформулированы указания, как методику предъявлять испытуемым, и т. д.);
3) меняющаяся ситуация обследования (разное время дня, когда проводятся эксперименты, разная освещенность помещения, наличие или отсутствие посторонних шумов и т. д.);
4) различия в манере поведения экспериментатора (от опыта к опыту по-разному предъявляет инструкции, по-разному стимулирует выполнение заданий и т. д.);
5) колебания в функциональном состоянии испытуемого (в одном эксперименте отмечается хорошее самочувствие, в другом — утомление и т. д.);
6) элементы субъективности в способах оценки и интерпретации результатов (когда ведется протоколирование ответов испытуемых, оцениваются ответы по степени полноты, оригинальности и т. п.).
Если все эти факторы иметь в виду и постараться в каждом из них устранить условия, снижающие точность измерений, то можно добиться приемлемого уровня надежности теста. Одним из важнейших средств повышения надежности психодиагностической методики является единообразие процедуры обследования, его строгая регламентация: одинаковые для обследуемой выборки испытуемых обстановка и условия работы, однотипный характер инструкций, одинаковые для всех временные ограничения, способы и особенности контакта с испытуемыми, порядок предъявления заданий и т. д. При такой стандартизации процедуры исследования можно существенно уменьшить влияние посторонних случайных факторов на результаты теста и таким образом повысить их надежность.
На характеристику надежности методик большое влияние оказывает исследуемая выборка. Она может как снижать, так и завышать этот показатель, например, надежность может быть искусственно завышена, если в выборке небольшой разброс результатов, т. е. если результаты по своим значениям близки друг к другу. В этом случае при повторном обследовании новые результаты также расположатся тесной группой. Возможные изменения ранговых мест испытуемых будут незначительными, и, следовательно, надежность методики будет высокой. Такое же неоправданное завышение надежности может возникнуть при анализе результатов выборки, состоящей из группы, имеющей очень высокие результаты, и из группы с очень низкими оценками по тесту. Тогда эти далеко отстоящие друг от друга результаты не будут перекрываться, даже если и вмешаются в условия эксперимента случайные факторы. Поэтому в руководстве обычно делается описание выборки, на которой определялась надежность методики.
В настоящее время надежность все чаще определяется на наиболее однородных выборках, т. е. на выборках, схожих по полу, возрасту, уровню образования, профессиональной подготовке и т. п. Для каждой такой выборки приводятся свои коэффициенты надежности. Приводимый показатель надежности применим только к группам, подобным тем, на которых он определялся. Если методика применяется к выборке, отличающейся от той, на которой проверялась ее надежность, то эта процедура должна быть проведена заново.