Use reforço de razão variável para tornar hábitos persistentes
Depois que um comportamento estiver estabelecido, mude para um programa de recompensa imprevisível para torná-lo resistente à extinção.
Why it works
Programas de razão variável (RV) recompensam o comportamento depois de um número imprevisível de respostas — a característica definidora do jogo de azar. RV produz a maior taxa de resposta e a extinção mais lenta de qualquer programa de reforço, porque cada resposta não recompensada pode ser a última antes da recompensa. O animal/humano não sabe quando parar porque a próxima resposta pode ser a vencedora. Isso torna hábitos de RV muito duradouros — mas também significa que podem ser explorados por designers de aplicativos e cassinos.
How to do it
- Estabeleça o comportamento em um programa contínuo ou fixo primeiro — recompense cada ocorrência até que seja confiável.
- Depois que o comportamento estiver consistente, introduza recompensas surpresa ocasionais: um mimo espontâneo, um check-in inesperado, uma comemoração aleatória.
- Mantenha as recompensas genuinamente imprevisíveis, não apenas infrequentes — uma recompensa semanal programada é um intervalo fixo, não variável.
- Use o reforço variável apenas para comportamentos que você quer manter, não para os que quer extinguir.
Evidência
Os efeitos do programa de razão variável sobre a taxa de resposta e a resistência à extinção estão entre as descobertas mais replicadas de Skinner, demonstradas em várias espécies e tipos de comportamento. (rct)
A maior parte dos dados fundamentais vem de pesquisa animal (pombos, ratos). A tradução para o comportamento humano complexo em contextos naturalísticos exige cuidado; o contexto social e cognitivo modula o efeito do programa.
Fontes
- Ferster & Skinner (1957), "Schedules of Reinforcement" — foundational experimental data
- Ferster, C. B., & Skinner, B. F. (1957). Schedules of Reinforcement. New York: Appleton-Century-Crofts.
Erro comum
Aplicar reforço variável antes de o comportamento estar estabelecido — a variabilidade durante a aquisição retarda o aprendizado; é uma ferramenta de manutenção, não de aquisição.
Pratique isso com IX Coach
More practices for Condicionamento Operante e Programas de Reforço
- Projete um reforçador positivo genuíno para o comportamento alvo
Identifique algo que genuinamente aumenta sua probabilidade de repetir o comportamento — não o que deveria funcionar, mas o que realmente funciona.
- Molde comportamentos complexos através de aproximações sucessivas
Reforce aproximações progressivamente mais próximas do comportamento alvo, em vez de esperar que o comportamento completo apareça.
- Extinga comportamentos indesejados removendo seu reforço
Pare um comportamento retendo consistentemente o reforçador que o mantém — não punindo-o.
- Use reforço diferencial para aumentar o comportamento desejado enquanto reduz o indesejado
Reforce o comportamento que você quer enquanto retém o reforço do que você não quer — ao mesmo tempo.
- Torne as consequências imediatas para superar o problema do atraso da recompensa
Quanto mais próxima no tempo uma consequência segue um comportamento, mais forte seu efeito sobre esse comportamento.
- Modifique antecedentes para disparar o comportamento antes que ele dependa de motivação
Mude os sinais que precedem um comportamento para torná-lo mais ou menos provável de ocorrer.
Conceitos relacionados
- Hábitos Atômicos, na Prática
The four laws, the real mechanisms, and where the science is strong
- Condicionamento Clássico e Gatilhos de Hábitos
How neutral cues become powerful habit triggers — and how to use that fact
- O Poder do Hábito, na Prática
The habit loop, craving, keystone habits, and an honest read on the science