Vue d'ensemble

Hugging Face Transformers 4.20, publié le 20 juin 2022, introduit la quantification GPTQ pour réduire la taille des modèles de langage.

Fonctionnalités principales

Quantification GPTQ

GPTQ permet de quantifier les modèles de langage en 4 ou 8 bits avec une perte de qualité minimale, réduisant significativement l'empreinte mémoire.

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = 'gpt2'
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)

# Génération de texte
inputs = tokenizer('Bonjour, je suis', return_tensors='pt')
outputs = model.generate(**inputs, max_length=50)
print(tokenizer.decode(outputs[0]))

Nouveaux modèles

De nouveaux modèles pré-entraînés sont ajoutés, incluant des architectures optimisées pour la génération de texte et la classification.

python
from transformers import pipeline

# Pipeline de classification
classifieur = pipeline('sentiment-analysis')
result = classifieur('This library is amazing!')
print(result)  # [{'label': 'POSITIVE', 'score': 0.99}]

# Pipeline de résumé
resumeur = pipeline('summarization')
texte = 'Long article text here...'
# resume = resumeur(texte, max_length=50)

Sources