Les grands modèles de langage comme Gemma 4 génèrent leurs réponses jeton après jeton. Ce mode de calcul crée une latence sensible dès que le modèle grossit. Google s’appuie donc sur des drafters spécialisés pour prévoir plusieurs jetons à l’avance e...