Quebrando o Silêncio Pedagógico em Juízes Online
SBIE 2026 · Goiânia, GO
Quebrando o silêncio pedagógico em juízes online
Aléssio Miranda Júnior · CEFET-MG / UFMG
Vinícius Fernandes dos Santos · UFMG
Juízes online escalam a avaliação de programas. Mas um veredito isolado raramente explica o que o estudante deve compreender para avançar.
WA · TLE
O código falhou, mas por quê? Lógica? Um caso de borda? Uma misconception? Complexidade?
Diagnóstico
Um retorno formativo orienta o próximo passo sem substituir o raciocínio do estudante.
“A avaliação automática em escala é necessária. O desafio é não confundir escalabilidade com silêncio.”
| Abordagem | Força | Limitação |
|---|---|---|
| Juízes online | Escalabilidade e portabilidade técnica | Veredito opaco e binário |
| Autograders acadêmicos | Feedback rico | Platform-lock |
| WOKDEX | Intenção pedagógica no artefato | Exige autoria curatorial |
O objetivo não é substituir o juiz online. É tornar o exercício portador de sua própria semântica pedagógica.
Camada descritiva título, nível, tags, dificuldade
Camada pedagógica skills e help tips
Camada avaliativa cenários tipados de teste
.in e .out.metadata.yaml descreve o propósito de cada cenário.exercise/ ├── metadata.yaml └── test-scenarios/ ├── d-sample/ │ ├── 01.in │ └── 01.out └── c-integer-division/ ├── 01.in └── 01.out
SAMPLE
Exemplos visíveis para depuração local.
FUNCTIONAL
Valida comportamento secreto e específico.
MISCONCEPTION
Expõe soluções acidentalmente corretas.
PERFORMANCE
Separa eficiência algorítmica de corretude.
Todos os testes ainda executam código. A diferença é que agora cada cenário declara a razão pedagógica pela qual existe.
SAMPLE
→
FUNCTIONAL
→
MISCONCEPTION
→
PERFORMANCE
→
AC
| Primeira falha | Feedback orientado |
|---|---|
SAMPLE |
Erro lógico básico |
FUNCTIONAL |
Comportamento incompleto ou caso de borda |
MISCONCEPTION |
Modelo mental incorreto identificado |
PERFORMANCE |
Lógica correta; é preciso otimizar |
Um estudante usa int para representar uma divisão que deveria produzir decimal.
| Cenário | Entrada | Saída do estudante | Diagnóstico |
|---|---|---|---|
SAMPLE |
10 / 2 |
5.00 |
passa acidentalmente |
MISCONCEPTION |
19 / 6 |
3.00 |
divisão inteira detectada |
MISCONCEPTION |
1 / 3 |
0.00 |
padrão confirmado |
Erro na declaração de tipo de variável. A divisão pode gerar resultado decimal; verifique o uso de
doubleoufloat.
O teste não apenas rejeita a solução. Ele distingue um erro aleatório de um padrão cognitivo consistente.
| Consistência de falhas no cenário | Resposta do sistema |
|---|---|
| Todos os casos falham | Dica direta: alta confiança |
| Metade ou mais falha | “Possível causa”: confiança moderada |
| Poucos casos falham | Dica genérica ou apoio de IA |
Precisão excessiva em uma única falha pode induzir um diagnóstico enganoso. A HMD preserva a incerteza quando ela existe.
45
exercícios curados
230
cenários de teste
3
níveis curriculares
FUNCTIONAL / lógica incompleta: 528 (61,68%) PERFORMANCE: 235 (27,45%) MISCONCEPTION: 93 (10,86%)
27,45%
soluções logicamente corretas, mas ineficientes
10,86%
diagnósticos de misconceptions
38,31%
vereditos opacos enriquecidos
MISCONCEPTION podem capturar slips.WOKDEX
O WOKDEX adiciona ao exercício uma camada de intenção pedagógica portátil: ele preserva o juiz online, mas transforma falhas opacas em oportunidades de diagnóstico e aprendizagem.
Artigo completo · Corpus aberto · alessiojr.com