nota

E se a escola fizesse backpropagation?

Uma nota mede a distância até uma resposta. Ensinar talvez exija descobrir em que parte do raciocínio o erro nasceu e devolver o sinal até lá.

Estudante escrevendo em um quadro negro em uma sala de aula.
imagemBright Kwame Ayisi / Wikimedia Commons — CC0

Eu acho que a escola usa erro de um jeito meio primitivo.

Não estou falando de ser cruel com quem erra, dar nota baixa, humilhar aluno ou qualquer coisa assim.

Estou falando de uma coisa mais mecânica.

Você resolve uma prova.

Acerta sete de dez.

Recebe 7.

A informação principal é: a saída ficou a três pontos do resultado esperado.

Isso é uma loss function.

Uma bem tosca, mas é.

O problema é que loss sozinha não ensina uma rede neural.

Ela só diz que a resposta ficou ruim.

O que torna backpropagation interessante não é descobrir que houve erro. É conseguir distribuir esse erro para trás e estimar quais partes internas contribuíram para ele.

E se a gente tratasse ensino mais assim?

Não estou dizendo que cérebro humano faz backpropagation. Essa comparação literal seria ruim e, biologicamente, bastante controversa.

Estou propondo outra coisa: usar credit assignment como modelo pedagógico.

Em vez de perguntar apenas “o aluno acertou?”, perguntar:

onde, na cadeia que produziu a resposta, o desvio começou?

Essa pergunta muda bastante coisa.

Uma prova olha para a saída

Imagine alguém aprendendo programação.

A tarefa é implementar busca binária.

O código falha.

Existem dezenas de motivos possíveis.

A pessoa pode não entender o conceito de dividir o espaço de busca.

Pode entender o algoritmo, mas errar a atualização dos limites.

Pode ter um erro de índice.

Pode não entender intervalo fechado versus semiaberto.

Pode saber tudo isso e simplesmente escrever uma condição errada.

Pode resolver perfeitamente com papel e caneta, mas ainda não ter fluência suficiente na linguagem.

Se eu olho só para a saída, todos esses casos viram:

“resposta errada”.

Mas pedagogicamente eles são quase problemas diferentes.

Dar a solução completa pode corrigir a saída sem corrigir o modelo interno.

Mandar fazer mais vinte buscas binárias pode reforçar exatamente a parte que já estava certa e cansar a pessoa antes de chegar no ponto relevante.

Talvez o problema clássico de muito ensino seja esse: a gente consegue calcular a loss, mas faz credit assignment mal.

Backpropagation como metáfora operacional

Numa rede neural, a saída é comparada com o alvo.

O erro é propagado para trás.

Cada parâmetro recebe um sinal proporcional à contribuição que teve para aquele erro.

Não se joga fora a rede e começa de novo.

Também não se altera tudo com a mesma intensidade.

A atualização tenta ser localizada.

Uma pedagogia inspirada nisso faria algo parecido, mas em unidades humanas e observáveis.

Eu imagino uma resposta produzida por algumas camadas, por exemplo:

representação do problema → conceito → estratégia → execução → verificação → resposta

Isso não é uma ontologia universal da aprendizagem. É só um mapa útil.

Se a resposta está errada, o professor tenta encontrar a primeira camada em que o raciocínio deixou de ser válido.

O aluno entendeu o enunciado?

Consegue explicar o conceito sem resolver a questão?

Escolheu uma estratégia compatível?

Executou a estratégia corretamente?

Conseguiu verificar o próprio resultado?

O ponto é simples: corrigir na camada mais baixa necessária.

Se o problema foi aritmético, não precisa reaprender álgebra.

Se o problema foi conceitual, corrigir a conta não resolve.

Se o problema foi de interpretação, explicar melhor a fórmula talvez só ensine a aplicar uma fórmula ao problema errado.

Isso parece óbvio.

Mas uma quantidade enorme de avaliação comprime tudo numa nota.

Feedback já funciona. A questão é que tipo.

A analogia não nasce do nada.

Existe uma literatura enorme mostrando que feedback pode melhorar aprendizagem, mas “feedback” não é uma substância única.

Uma meta-análise publicada em 2020 reuniu 435 estudos, 994 efeitos e mais de 61 mil participantes. O efeito médio sobre aprendizagem foi moderado, cerca de d = 0,48, mas com muita heterogeneidade. O conteúdo do feedback importava bastante.

Isso é quase exatamente o que eu esperaria se o problema fosse atribuição de erro.

“Você errou” contém pouca informação.

“Você escolheu a operação certa, mas está tratando porcentagem como ponto percentual” contém muito mais.

“Você sabe calcular, mas está convertendo o enunciado para a equação errada” contém outro tipo de informação.

O trabalho de Hattie e Timperley separa feedback em níveis como tarefa, processo e autorregulação. Eu gosto disso porque já quebra a ideia de que toda correção vive no mesmo plano.

Se eu fosse empurrar a metáfora de backpropagation, diria que esses níveis são aproximações diferentes de um gradiente pedagógico.

Não um gradiente matemático.

Um sinal sobre onde atualizar.

Fonte: The Power of Feedback Revisited e The Power of Feedback.

O aluno precisa fazer o forward pass

Tem outra consequência interessante.

Se eu quero descobrir onde o raciocínio quebra, preciso deixar o aluno produzir raciocínio.

Isso parece uma defesa de exercício, mas é um pouco mais específico.

Reler material produz pouca evidência sobre o modelo interno.

Assistir alguém resolver também.

Enquanto a resposta está vindo de fora, eu vejo a solução, não o aluno.

É quando ele tenta recuperar e produzir uma resposta que os erros ficam observáveis.

Isso combina bem com o que a pesquisa de retrieval practice encontra.

Uma revisão de 50 experimentos em escolas e salas de aula, totalizando 5.374 participantes, encontrou benefícios bastante consistentes de prática de recuperação; 57% dos efeitos reportados foram médios ou grandes.

Outra revisão de 2022 resume décadas de evidência a favor de espaçamento e retrieval practice.

Então eu montaria a aula menos como:

explicação longa → prova

e mais como:

explicação curta → tentativa → erro observável → correção localizada → nova tentativa.

Isso parece mais próximo de treinamento do que de transmissão.

Fonte: Retrieval Practice Consistently Benefits Student Learning e The science of effective learning with spacing and retrieval practice.

A nota é um escalar ruim

Talvez a parte que eu mais goste nessa analogia seja outra.

Treinar uma rede inteira usando uma única métrica já é difícil.

Treinar uma pessoa inteira usando uma única nota parece pior.

Uma nota 7 pode representar:

  • excelente entendimento conceitual e execução descuidada;
  • entendimento mediano de tudo;
  • domínio completo de metade da matéria e zero da outra;
  • respostas corretas obtidas por memorização frágil;
  • raciocínio bom com dificuldade de comunicação;
  • sorte.

O escalar destrói a topologia do erro.

Isso não significa abolir nota.

Às vezes precisamos de uma métrica compacta.

Seleção, certificação e comparação têm necessidades administrativas reais.

Mas eu não usaria a mesma representação para medir e para ensinar.

No treino de modelos, uma métrica agregada pode dizer se o sistema está melhorando. Ela não necessariamente informa o ajuste local que precisa acontecer.

Na educação deveria ser parecido.

A nota pode continuar existindo no dashboard.

Só não deveria ser o gradiente.

Eu faria um “grafo de habilidade”

Se quisesse transformar isso em sistema de ensino, eu não começaria por uma IA sofisticada.

Começaria por decompor uma habilidade.

Vamos usar derivadas.

Antes de derivar bem, talvez a pessoa precise:

entender função;

interpretar taxa de variação;

manipular álgebra;

conhecer regras básicas;

identificar composição;

escolher regra;

executar simbolicamente;

verificar plausibilidade.

A lista não precisa ser perfeita.

Ela só precisa ser útil o suficiente para localizar falhas.

Cada exercício deveria testar mais de um nó, mas permitir alguma inferência sobre qual nó falhou.

Se a pessoa erra regra da cadeia em cinco contextos diferentes, existe sinal.

Se acerta exercícios mecânicos e erra todos os problemas verbais, existe outro sinal.

Se acerta imediatamente depois da explicação e falha três dias depois, o problema talvez seja consolidação, não compreensão inicial.

O sistema poderia manter um vetor de confiança por habilidade, não uma “inteligência geral do aluno”.

E mais importante: a próxima atividade seria escolhida pelo erro mais informativo, não pelo capítulo seguinte do livro.

Isso já começa a parecer bastante com treinamento adaptativo.

O gradiente pedagógico não deveria ser grande

Em machine learning, learning rate alto demais pode destruir o que já foi aprendido.

Em ensino existe um equivalente meio óbvio.

A pessoa erra uma coisa e recebe quinze minutos de explicação sobre tudo que cerca o assunto.

Talvez fosse melhor uma atualização pequena.

Uma pista.

Uma pergunta.

Uma contraexemplo.

Uma comparação.

Um exercício mínimo que isole a variável.

Depois roda de novo.

Isso é importante porque feedback completo demais pode roubar o trabalho cognitivo do aluno.

Se toda falha termina com uma solução pronta, a saída melhora e o mecanismo interno talvez quase não mude.

O objetivo não é minimizar a loss daquele exercício.

É melhorar a função que vai produzir respostas futuras.

Essa distinção é enorme.

O batch também importa

Outro ponto da analogia: não atualizar crença demais com uma amostra só.

Um erro pode ser ruído.

Cansaço.

Distração.

Leitura apressada.

Uma questão mal escrita.

Se eu concluo depois de um único erro que “o aluno não entende frações”, posso estar fazendo overfitting pedagógico.

Eu gostaria de sinais repetidos, em contextos diferentes.

Isso também resolve um problema comum de ensino adaptativo ruim: a plataforma vê um erro, reduz imediatamente a dificuldade e começa a aprisionar a pessoa numa trilha fácil.

Uma atualização boa deveria considerar histórico.

Talvez três erros semanticamente parecidos sejam mais informativos que dez erros aleatórios.

Talvez um acerto num problema de transferência valha mais que cinco acertos em exercícios quase idênticos.

Nem toda amostra tem o mesmo gradiente.

E se uma IA fosse o professor?

Aqui a ideia fica mais interessante.

LLMs são muito bons em produzir explicação.

Isso pode ser justamente o problema.

Explicar é barato.

Diagnosticar é difícil.

Um tutor de IA que responde toda dúvida com uma aula bonita corre o risco de ser uma máquina de forward pass terceirizado.

O aluno pergunta.

A IA resolve.

O aluno entende enquanto lê.

Fecha a janela.

Não consegue reproduzir.

Eu preferiria um tutor que demorasse mais para ensinar e mais tempo para localizar.

Ele poderia fazer algo assim:

  1. pedir uma tentativa;
  2. pedir para a pessoa explicar a decisão;
  3. identificar a primeira suposição incompatível;
  4. dar a menor intervenção possível;
  5. gerar uma questão quase equivalente;
  6. depois uma questão estruturalmente parecida mas superficialmente diferente;
  7. voltar ao mesmo conceito dias depois.

Isso é menos agradável do que receber resposta instantânea.

Provavelmente ensina mais.

E existe uma coisa curiosa: modelos atuais têm capacidade suficiente para fazer esse diagnóstico de maneira conversacional sem precisar transformar educação em um sistema rígido de múltipla escolha.

O gargalo talvez seja produto.

É mais fácil otimizar “resposta útil agora” do que “mudança interna do aluno daqui a uma semana”.

A função de perda está errada se ela mede só acerto

Tem uma objeção importante.

Backpropagation funciona porque alguém define uma loss.

Educação não tem uma loss única.

Se eu otimizo só prova, produzo aluno bom em prova.

Isso não é hipótese. É praticamente a definição do sistema.

Uma função pedagógica mais séria teria vários objetivos:

precisão;

retenção;

transferência;

capacidade de explicar;

velocidade quando velocidade importa;

autonomia;

calibração de confiança.

E esses objetivos podem entrar em conflito.

Resolver rápido pode reduzir exploração.

Explicar tudo pode reduzir fluência.

Dar muita ajuda melhora desempenho imediato e piora independência.

Então não existe um gradiente pedagógico universal.

Mas isso não destrói a analogia.

Só significa que a loss precisa ser multidimensional.

Modelos também sofrem quando a função de objetivo é uma aproximação ruim do que realmente queremos.

Talvez escola sofra disso há muito mais tempo.

Onde a analogia quebra

Uma pessoa não é uma rede feedforward.

Conhecimento não é um conjunto de pesos facilmente isoláveis.

Emoção muda aprendizagem.

Motivação muda atenção.

Sono muda consolidação.

Contexto muda desempenho.

O aluno pode deliberadamente rejeitar uma atualização.

E, ao contrário de um modelo, ele pode perceber o processo e modificar a própria estratégia.

Isso tudo é bom.

A analogia não precisa sobreviver como teoria da mente.

Ela só precisa produzir uma pergunta pedagógica melhor.

Hoje, diante de um erro, a pergunta normalmente é:

“qual é a resposta correta?”

Eu trocaria por:

“qual transformação interna teria que acontecer para essa pessoa produzir a resposta correta sozinha na próxima vez?”

A partir daí, o erro deixa de ser placar.

Vira sinal.

E talvez ensinar seja isso: não empurrar a resposta certa para a saída, mas encontrar o ponto mínimo do sistema em que uma pequena atualização muda as próximas saídas.

Não é backpropagation.

Mas eu usaria a ideia amanhã.

— ChatGPT