Обучение с подкреплением (стр. 5 из 7)

Стимулы

Все, что вызывает какую-либо поведенческую реакцию, называется стимулом. Некоторые стимулы способны вызывать реакции без какого-либо обучения или тренировки: мы вздрагиваем от громкого звука, моргаем от яркого света, нас тянет в кухню, когда до нас доносится аппетитный запах; животные поступают точно так же. Такие звуки, свет и запахи называются безусловными, или первичными, стимулами.

Другие стимулы заучиваются благодаря ассоциации. Сами по себе они могут ничего не значить, но становятся выделяемыми сигналами для поведения: сигналы светофора заставляют нас стоять или идти, мы вскакиваем, чтобы снять трубку зазвонившего телефона, на шумной улице оборачиваемся, услышав свое имя и т.д., и т.д. Ежедневно мы отвечаем на множество выученных сигналов. Они называются условными, или вторичными, стимулами.

При формальном тренинге львиная доля усилий приходится на образование условных сигналов. Сержант, занимающийся строевой подготовкой со взводом новобранцев, и хозяин собаки на дрессировочной площадке в равной мере стремятся сделать в основном так, чтобы обучающиеся повиновались командам, которые в действительности являются условными сигналами. Фокус не в том, что собака может сидеть, а человек останавливаться, фокус в том, что это делается четко и по команде. Вот что мы называем повиновением — не просто выполнение действия, но гарантия того, что оно будет выполнено по сигналу. Психологи называют это “поставить поведение под контроль стимулов”. Это вырабатывается с трудом, выработка основывается на правилах, а правила нуждаются в проверке.

Если вы руководите людьми и вам иногда приходится два или три раза повторять приказ или инструкцию, прежде чем они будут выполнены, то значит у вас проблемы со стимульным контролем. Разве не случается, что вы говорите: “Я тебе уже однажды сказала, я говорила тебе тысячу раз, не...” (Не хлопай дверью, или не клади мокрый купальник на кровать, или что-либо в этом роде.) Когда сказать один или тысячу раз недостаточно, поведение не управляется стимулами.

Иногда может казаться, что мы обладаем стимульным контролем, когда в действительности этого нет. Мы предполагаем, что сигналу или команде должны подчиниться, а этого не происходит. Самой распространенной реакцией на это является усиление сигнала. Так, официант не понимает вашего французского? Говорите громче. Чаще всего это не помогает. Субъект должен распознавать сигнал, иначе безразлично, кричите ли вы что есть мочи или даже ревете с помощью усилительной аппаратуры рок-ансамбля, на вас будут смотреть невидящим взором.

Другой реакцией человека на игнорирование условного сигнала является бешенство, которое действует только в том случае, если субъект проявляет преднамеренное непослушание, не давая твердо заученного ответа на хорошо выученный сигнал. При этом иногда, показав характер, можно получить хорошее поведение.

Бывает, что субъект отвечает правильно, но с очень большой задержкой или через пень-колоду. Часто неуклюжие ответы на команды определяются тем, что субъект не обучен отвечать быстро. Без положительного подкрепления не только за правильный, но и за проворный ответ на сигнал у субъекта нет шансов усвоить, что успех приносит быстрое повиновение стимулам. При этом поведение в действительности не контролируется стимулами.

Реальная жизнь” изобилует плохой организацией управления с помощью стимулов. Как только один человек пытается проявить власть, другой оказывается в опасности проявить “непослушание” В действительности проблема состоит в непонимании команд или сигналов, которым он поэтому не может повиноваться. Это примеры плохой коммуникации или нечеткого управления с. Помощью стимулов.

Правила управления с помощью стимулов

Для того, чтобы управлять с помощью сигналов, надо сформировать нужное поведение, а затем, когда оно осуществляется, делать так, чтобы оно происходило во время или сразу после какого-либо определенного сигнала. Этот стимул затем становится ключом, или сигналом, поведения.

Полный контроль с помощью стимулов определяется четырьмя условиями, к каждому из которых следует относиться как к самостоятельному разделу тренировочной задачи, самостоятельному пункту программы выработки:

1. Поведение всегда осуществляется сразу после подачи условного стимула (собака ладится, когда ей приказывают).

2. Поведение никогда не возникает в отсутствие стимула (во время занятий или работы собака никогда не садится спонтанно).

3. Поведение никогда не наблюдается в ответ на другие стимулы (если вы говорите: “Лежать!”, собака не должна садиться).

4. Никакое другое поведение не возникает в ответ на данный стимул (когда вы говорите; “Сидеть!” собака не должна ложиться или скакать и лизать ваше лицо)

Только когда все четыре условия соблюдаются, собака действительно полностью и окончательно понимает команду “Сидеть!”. Теперь вы действительно управляете ею с помощью стимула.

Жизненно важно сигнальное управление в военном деле. Занятия по строевой подготовке с новобранцами — утомительное и трудоемкое дело, и им самим оно может казаться трудным и бессмысленным, но оно выполняет очень важную функцию. Строевая подготовка не только вырабатывает точные реакции на строевые команды, что дает возможность командирам с легкостью приводить в движение большие группы людей, но она также вырабатывает навык ответа на условный сигнал вообще: повиновение команде, которое в конце концов является не столько умственным актом, сколько выученным умением, являющимся решающим, а часто и жизненно важным для солдата. С тех пор как были придуманы армии, строевая подготовка являлась способом выработки этого навыка.

Что может быть сигналом?

Условным стимулом — выученным сигналом может быть все, абсолютно все, что может быть воспринято. Флаги, свет, слова, прикосновения, вибрация, хлопки пробок шампанского — короче говоря, безразлично, какой сигнал вы использует те Коль скоро субъект может воспринимать его, сигнал может быть использован для вызова выученного поведения.

В то время, как на каждый отдельный сигнал вам надо получать только какое-либо одно поведение, вполне достижимо получение одного и того же поведения на несколько условных сигналов. Например, в переполненном людьми помещении оратор может потребовать тишины, воскликнув: “Тихо!”, или встать и, подняв руку, жестом призвать к молчанию. А если присутствующие шумят и при этом находятся в некотором подпитии и, следовательно, отличаются рассеянным вниманием, поможет позвякивание ложкой по стакану. Мы все обучены осуществлять данное поведение в ответ на любой из, по крайней мере, трех этих стимулов.

Введение второго условного стимула для выученного поведения называется переносом стимулов. Чтобы добиться переноса, вы предъявляете старый стимул — допустим, команду, поданную голосом, — как всегда, и новую команду — скажем, сигнал, поданный рукой, — и подкрепляете ответ; затем постепенно делаете старый стимул все менее и менее заметным и одновременно привлекаете внимание к новому, делая его очень выраженным, пока на новый стимул не будете получать столь же хороший ответ, даже тогда, когда старый стимул не предъявляется вовсе. Обычно этот процесс идет несколько быстрее, чем выработка ответа на первоначальный стимул; когда уже выработано “Выполняй это действие” и “Выполняй это действие по команде”, то легче выработать “Выполняй это действие также по другой команде”.

Время отставания

Чтобы добиться точности, ответа на условный стимул, полезно применять прием ограничения времени отставания. Допустим, ваш подопечный обучился совершать какое-либо действие в ответ на условный сигнал, но обычно имеется некоторый интервал времени между предъявлением стимула и ответом субъекта. Вы пригласили людей на ужин, и они немого запоздали, или ваш слон после сигнала к остановке постепенно замедляет ход и, наконец, останавливается.

Если вы хотите, то, используя ограничение времени отставания, можете в процессе тренировки так сократить этот интервал, что поведение будет возникать так быстро, как это только физически возможно.

Вы начинаете с того, что устанавливаете нормативный интервал, с которым обычно наблюдается поведение; затем вы подкрепляете только то поведение, которое совершается в течение этого интервала. Поскольку живые существа характеризуются вариабельностью, некоторые ответы будут выходить за пределы интервала и за них не будет даваться подкрепление. Например, если вы подаете ужин точно в назначенное в приглашении время, а не ждете опоздавших, то они рискуют получить все холодное или застать меньший выбор,

Когда вы подобным образом установите временной интервал и будете давать подкрепление только на его протяжении, то скоро вы обнаружите, что постепенно все ответы начинают наблюдаться в его пределах и ни один не выходит за него. Теперь вы снова можете подтянуть гайки. Достаточно ли пятнадцати минут, чтобы семья собралась? Начните подавать на стол через двенадцать минут после того, как всех позвали, или через десять. Как быстро вы будете закручивать гайки, должно быть точно определено; как и при каждом процессе выработки желательно находиться в тех пределах, в которых наиболее часто наблюдается данное поведение.

Животные и люди имеют очень развитое чувство времени и чрезвычайно четко реагируют на выработку времени отставания, но дрессировщик не должен полагаться на авось. Пользуясь часами или даже секундомером, если хотите, чтобы выработка отставания работала на вас. Для поведения ближайших окружающих, включая себя, сократите время ответа, скажем, с пяти тактов до двух. И конечно, если вы работаете с людьми, не обсуждайте ваши действия; вы не получите ничего, кроме возражений. Просто делайте и смотрите, что получается.