🔍 Visualizador del Mecanismo de Atención
Attention Heatmap Explorer · Modelo: BERT en español (dccuchile/bert-base-spanish-wwm-cased)
Escribí una frase y explorá cómo cada cabeza de atención en cada capa del Transformer pondera la relación entre tokens. El color más oscuro indica mayor peso de atención.
Capa 12 (alta): Captura relaciones semánticas abstractas y de contexto global — ideal para ver cómo el modelo 'entiende' el significado de la frase.
💡 Experimentos sugeridos
Probá estos recorridos en orden para explorar el modelo:
1. El rol de los tokens especiales
Dejá la frase por defecto, capa 11, head 0. Observá cómo [CLS] y [SEP] acumulan
atención desde casi todos los demás tokens — son los "buzones" de contexto global del modelo.
2. Cada head ve algo distinto
Con la misma frase y capa, recorré los heads del 0 al 11. Vas a ver patrones completamente
diferentes: algunos diagonales (atención al token adyacente), otros con columnas iluminadas
en [CLS], otros con relaciones semánticas cruzadas.
3. La profundidad cambia el tipo de relación Elegí un head y recorré las capas de 0 a 11. Las capas bajas muestran atención local (tokens cercanos); las capas altas revelan relaciones semánticas de largo alcance.
4. Ambigüedad léxica Usá la frase "El banco del parque está cerca del banco financiero" y buscá heads que distingan los dos usos de "banco" — es una demostración directa de representación contextual.
5. Correferencia Con "María le dio el libro a Juan porque él lo necesitaba", buscá heads donde "él" presta atención a "Juan" y "lo" presta atención a "libro" — el modelo resolvió las referencias pronominales sin que nadie se lo enseñara explícitamente.
Fórmula de Self-Attention:
Attention(Q, K, V) = softmax(QKᵀ / √dₖ) · VEl heatmap muestra la matriz de pesossoftmax(QKᵀ / √dₖ)— cada fila suma 1.0.