WOKDEX: do Veredito Binário ao Feedback Formativo

Quebrando o Silêncio Pedagógico em Juízes Online

Aléssio Miranda Júnior · Vinícius Fernandes dos Santos

0.1

SBIE 2026 · Goiânia, GO

1 WOKDEX: do Veredito Binário ao Feedback Formativo

Quebrando o silêncio pedagógico em juízes online

Aléssio Miranda Júnior · CEFET-MG / UFMG
Vinícius Fernandes dos Santos · UFMG

1.1 O problema não é corrigir código

  1. O silêncio pedagógico

1.2 O problema é transformar a correção em aprendizagem

Juízes online escalam a avaliação de programas. Mas um veredito isolado raramente explica o que o estudante deve compreender para avançar.

1.3 O silêncio pedagógico

1.3.1 O estudante recebe uma resposta curta para um problema complexo

WA · TLE

O código falhou, mas por quê? Lógica? Um caso de borda? Uma misconception? Complexidade?

Diagnóstico

Um retorno formativo orienta o próximo passo sem substituir o raciocínio do estudante.

“A avaliação automática em escala é necessária. O desafio é não confundir escalabilidade com silêncio.”

  • Juízes tradicionais: portáveis e escaláveis.
  • Autograders: feedback mais rico, porém preso à plataforma.
  • Falta uma camada de portabilidade pedagógica.

1.4 A lacuna entre duas abordagens

Abordagem Força Limitação
Juízes online Escalabilidade e portabilidade técnica Veredito opaco e binário
Autograders acadêmicos Feedback rico Platform-lock
WOKDEX Intenção pedagógica no artefato Exige autoria curatorial

O objetivo não é substituir o juiz online. É tornar o exercício portador de sua própria semântica pedagógica.

1.5 A proposta: WOKDEX

1.5.1 Metadados que viajam com o exercício

  • Schema em YAML, validado por JSON Schema.
  • Cenários de teste recebem intenção pedagógica explícita.
  • Habilidades e dicas ficam associadas ao artefato.
  • O mesmo pacote pode ser interpretado por diferentes plataformas.

Camada descritiva título, nível, tags, dificuldade

Camada pedagógica skills e help tips

Camada avaliativa cenários tipados de teste

1.6 O artefato WOKDEX

1.6.1 Estrutura preserva o padrão conhecido

  • Diretórios continuam contendo pares .in e .out.
  • Um metadata.yaml descreve o propósito de cada cenário.
  • O motor usa os metadados para decidir como interpretar a falha.

exercise/ ├── metadata.yaml └── test-scenarios/ ├── d-sample/ │ ├── 01.in │ └── 01.out └── c-integer-division/ ├── 01.in └── 01.out

1.7 Quatro intenções para os testes

SAMPLE

Exemplos visíveis para depuração local.

FUNCTIONAL

Valida comportamento secreto e específico.

MISCONCEPTION

Expõe soluções acidentalmente corretas.

PERFORMANCE

Separa eficiência algorítmica de corretude.

Todos os testes ainda executam código. A diferença é que agora cada cenário declara a razão pedagógica pela qual existe.

1.8 Avaliar na ordem em que o estudante aprende

SAMPLE

FUNCTIONAL

MISCONCEPTION

PERFORMANCE

AC

1.8.1 Fluxo fail-fast com diagnóstico diferenciado

Primeira falha Feedback orientado
SAMPLE Erro lógico básico
FUNCTIONAL Comportamento incompleto ou caso de borda
MISCONCEPTION Modelo mental incorreto identificado
PERFORMANCE Lógica correta; é preciso otimizar

1.9 Exemplo CS1: divisão inteira

1.9.1 O falso positivo

Um estudante usa int para representar uma divisão que deveria produzir decimal.

Cenário Entrada Saída do estudante Diagnóstico
SAMPLE 10 / 2 5.00 passa acidentalmente
MISCONCEPTION 19 / 6 3.00 divisão inteira detectada
MISCONCEPTION 1 / 3 0.00 padrão confirmado

1.9.2 Feedback WOKDEX

Erro na declaração de tipo de variável. A divisão pode gerar resultado decimal; verifique o uso de double ou float.

O teste não apenas rejeita a solução. Ele distingue um erro aleatório de um padrão cognitivo consistente.

1.10 HMD: quando emitir uma dica?

1.10.1 Heurística de Modulação de Dica

Consistência de falhas no cenário Resposta do sistema
Todos os casos falham Dica direta: alta confiança
Metade ou mais falha “Possível causa”: confiança moderada
Poucos casos falham Dica genérica ou apoio de IA

Precisão excessiva em uma única falha pode induzir um diagnóstico enganoso. A HMD preserva a incerteza quando ela existe.

1.11 Corpus de referência

1.11.1 A proposta foi instanciada em problemas reais

  • Exercícios pré-existentes de OBI e ICPC foram reclassificados e anotados.
  • A progressão cobre competências de CS1, CS2 e CS3.
  • O corpus e a documentação são disponibilizados em formato aberto.

45

exercícios curados

230

cenários de teste

3

níveis curriculares

1.12 Validação retrospectiva in-silico

1.12.1 Reprocessamento de 856 submissões anteriormente reprovadas

FUNCTIONAL / lógica incompleta: 528 (61,68%) PERFORMANCE: 235 (27,45%) MISCONCEPTION: 93 (10,86%)

27,45%

soluções logicamente corretas, mas ineficientes

10,86%

diagnósticos de misconceptions

38,31%

vereditos opacos enriquecidos

1.13 Limitações e próximos passos

1.13.1 Limitações atuais

  • Diagnósticos de MISCONCEPTION podem capturar slips.
  • Dicas muito específicas podem incentivar tentativa e erro.
  • A evidência ainda é retrospectiva e focada em linguagens imperativas/OO.

1.13.2 Agenda de pesquisa

  • Estudo in-vivo com turmas e grupos de controle.
  • Calibração da HMD com dados reais de uso.
  • Testes de mutação e apoio de IA na autoria.
  • Integração com xAPI, LTI e QTI.

1.14 Conclusão

WOKDEX

1.15 Avaliar em escala não precisa significar avaliar em silêncio

O WOKDEX adiciona ao exercício uma camada de intenção pedagógica portátil: ele preserva o juiz online, mas transforma falhas opacas em oportunidades de diagnóstico e aprendizagem.