🔍 Visualizador del Mecanismo de Atención

Attention Heatmap Explorer · Modelo: BERT en español (dccuchile/bert-base-spanish-wwm-cased)

Escribí una frase y explorá cómo cada cabeza de atención en cada capa del Transformer pondera la relación entre tokens. El color más oscuro indica mayor peso de atención.

📝 Ejemplos sugeridos
0 11
0 11

Capa 12 (alta): Captura relaciones semánticas abstractas y de contexto global — ideal para ver cómo el modelo 'entiende' el significado de la frase.


💡 Experimentos sugeridos

Probá estos recorridos en orden para explorar el modelo:

1. El rol de los tokens especiales Dejá la frase por defecto, capa 11, head 0. Observá cómo [CLS] y [SEP] acumulan atención desde casi todos los demás tokens — son los "buzones" de contexto global del modelo.

2. Cada head ve algo distinto Con la misma frase y capa, recorré los heads del 0 al 11. Vas a ver patrones completamente diferentes: algunos diagonales (atención al token adyacente), otros con columnas iluminadas en [CLS], otros con relaciones semánticas cruzadas.

3. La profundidad cambia el tipo de relación Elegí un head y recorré las capas de 0 a 11. Las capas bajas muestran atención local (tokens cercanos); las capas altas revelan relaciones semánticas de largo alcance.

4. Ambigüedad léxica Usá la frase "El banco del parque está cerca del banco financiero" y buscá heads que distingan los dos usos de "banco" — es una demostración directa de representación contextual.

5. Correferencia Con "María le dio el libro a Juan porque él lo necesitaba", buscá heads donde "él" presta atención a "Juan" y "lo" presta atención a "libro" — el modelo resolvió las referencias pronominales sin que nadie se lo enseñara explícitamente.


Fórmula de Self-Attention: Attention(Q, K, V) = softmax(QKᵀ / √dₖ) · V El heatmap muestra la matriz de pesos softmax(QKᵀ / √dₖ) — cada fila suma 1.0.