Loading
Changez l'unique adjectif qui décide du référent de « it ». La réponse d'un lecteur s'inverse. Aucune des seize têtes ne change de gagnant.
Ouvrir l'instrumentThe trophy didn't fit in the suitcase because it was too big.
Vous savez ce que « it » désigne. Changez un mot — big en small — et vous savez que la réponse s'inverse, sans effort, parce que vous comprenez ce qui rentre dans quoi.
C'est une phrase de Winograd, et c'est le test le plus net que je connaisse pour savoir si l'attention fait ce que l'on croit.
L'idée décisive : le basculement immédiat et évident pour vous est invisible pour le modèle. Pas faiblement présent. Pas partiellement détecté. Invisible.
The trophy didn't fit in the suitcase because it was too big.
Aucune tête n'a bougé. Le basculement qui vous saute aux yeux est invisible pour le modèle.
Deux phrases qui diffèrent d'un adjectif. La réponse d'un lecteur pour « it » s'inverse entre les deux. Les gagnants sont comparés par position, car pour deux têtes le gagnant est l'adjectif échangé lui-même.
Changez l'adjectif : le modèle bouge à peine. La masse de rollout sur trophy passe de 0,0611 à 0,0616. Celle sur suitcase passe de 0,0680 à 0,0740 — elle dérive légèrement dans la direction qu'un lecteur prendrait, et les deux phrases continuent de placer plus de poids sur suitcase, quelle que soit la bonne réponse.
Puis le chiffre qui tranche : aucune des seize têtes ne change de gagnant.
Pas une tête, dans aucune couche, ne choisit un mot différent pour it quand la réponse change. Quoi que calculent ces têtes, la coréférence n'en fait pas partie.
Une note de méthode, car elle a failli produire une affirmation fausse. Ma première comparaison appariait les gagnants par mot et signalait deux têtes changeantes. Les deux avaient choisi l'adjectif lui-même — big dans une phrase, small dans l'autre — soit la même position sous une autre étiquette. La comparaison par position donne zéro. Une métrique peut être raisonnable, défendable, et discrètement fausse sur la question réellement posée.
Le modèle ne peut pas résoudre la référence. C'est un fait sur un encodeur à quatre couches, et la réponse honnête n'est pas de le cacher mais de le placer là où il mord.
Les mots dont le modèle ne peut pas retrouver le référent — it, he, she, they, this, les possessifs — portent un avertissement dans le classement quand vous les ciblez. Pas une clause en pied de page : une note attachée à la ligne précise où la limite s'applique.
Et ces phrases sont totalement exclues du pool de suggestions. La phrase du trophée invite le visiteur à poser une question à laquelle le modèle ne peut pas répondre, et un outil qui pose une question sans réponse paraît cassé alors qu'il fonctionne.
Les pronoms relatifs ne sont délibérément pas sur cette liste. Who, which, that renvoient à leur antécédent par la syntaxe et non par la connaissance du monde, et le modèle les traite correctement : that → Birds 0,860, who → Students 0,700, that → letters 0,680. Avertir que « l'attention ne résout pas la référence » au-dessus d'une ligne qui l'a résolue serait la même erreur en sens inverse — l'excès de prudence est aussi une inexactitude.
Après dix articles, voici l'inventaire honnête.
Elle vous dit : dans quelle proportion le vecteur value d'une position est entré dans la sortie d'une autre position, dans une tête, à une couche. C'est un fait réel sur un calcul réel, et ce modèle encode bien une syntaxe locale vérifiable à la lecture — verbe à objet, préposition à son objet, adjectif à son nom, pronom relatif à son antécédent, accord sujet-verbe par-dessus quelques mots.
Elle ne vous dit pas : que le modèle a compris une relation. Que ce poids a compté dans la sortie — la partie 9 a mesuré cet écart et l'a trouvé substantiel. Que la référence a été résolue. Que quoi que ce soit ressemblant à un raisonnement a eu lieu.
L'écart entre ces deux listes est l'endroit où vit presque toute visualisation d'attention trompeuse. Non pas en fabriquant des nombres — ils sont généralement réels — mais en laissant le lecteur transporter une impression de la première liste vers la seconde.
Cinq choses que ce projet m'a coûtées, dans l'ordre où je les ai apprises.
Une arithmétique correcte n'est pas la correction. Chaque défaut digne d'être raconté ici avait la même forme : les calculs étaient justes et la présentation trompait. Ce mode de défaillance n'apparaît pas dans les tests, car les tests vérifient les calculs.
Votre intuition ne peut pas arbitrer une sortie numérique. Un transformeur subtilement cassé ressemble exactement à un transformeur correct. Construisez la seconde implémentation. Validez-la avant de lui faire confiance. Acceptez qu'elle soit parfois celle qui a tort.
Un test qui ne peut pas échouer n'est pas un test. Cassez votre propre code délibérément et vérifiez que chaque garde se déclenche. Deux étapes de mon script de comparaison affichaient des erreurs sans rien affirmer, et je ne l'ai découvert qu'en perturbant les données.
Mesurez avant de construire, et fixez d'abord la condition d'abandon. L'idée pondérée par la norme était séduisante, bien citée, et aurait pris une journée à livrer. La mesurer a pris un après-midi et a répondu non. Écrire à l'avance à quoi ressemble un « non » est ce qui l'a empêché de devenir une rationalisation après coup.
La divulgation est une fonctionnalité, pas un aveu. Chaque endroit où cet outil dit « voici ce que ce nombre ne signifie pas » le rend plus utile, pas moins. La version qui cachait ses réserves était moins fiable et pas plus impressionnante.
Un instrument qui vous dit ce qu'il ne peut pas voir vaut mieux qu'un instrument qui laisse croire qu'il voit tout. C'est toute la thèse, et il aura fallu dix articles et une fonctionnalité supprimée pour y arriver.
L'instrument est sur /projects/mind-map/scene. Tapez une phrase ; elle ne quitte jamais votre appareil.
Plus à lire
Il divise le problème par deux sans le dissoudre. [CLS] porte 0,63× la norme de valeur d'un token de contenu — pas le quasi-zéro annoncé. Quatre couches ne font pas douze.
J'ai écrit le code et les tests à partir de la même idée fausse, et ils s'accordaient parfaitement. Tout était vert.
Chaque ligne de rollout se situe entre 0,935 et 0,971 d'entropie normalisée. C'est une distribution uniforme déguisée en classement, et c'était la vue par défaut.