La refonte des tokenizers

Transformers 5.0 supprime la distinction Fast/Slow des tokenizers. Tous les tokenizers utilisent désormais le backend Rust (tokenizers) par défaut, offrant des performances uniformes. Les anciennes classes Python pures sont retirées.

Migration

Le code utilisant AutoTokenizer fonctionne sans changement. Les références explicites à *TokenizerFast doivent être remplacées par la classe de base.

python
from transformers import AutoTokenizer

# Fonctionne sans changement
tok = AutoTokenizer.from_pretrained('bert-base-uncased')
print(type(tok))  # BertTokenizer (backend Rust)

# Avant : deux classes
# from transformers import BertTokenizer      # lent (Python)
# from transformers import BertTokenizerFast  # rapide (Rust)

# Après : une seule classe, toujours rapide
from transformers import BertTokenizer
tokens = tok('Bonjour le monde', return_tensors='pt')
print(tokens.input_ids.shape)  # torch.Size([1, 5])

Sources