Vue d'ensemble
Hugging Face Transformers 4.20, publié le 20 juin 2022, introduit la quantification GPTQ pour réduire la taille des modèles de langage.
Fonctionnalités principales
Quantification GPTQ
GPTQ permet de quantifier les modèles de langage en 4 ou 8 bits avec une perte de qualité minimale, réduisant significativement l'empreinte mémoire.
python
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = 'gpt2'
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)
# Génération de texte
inputs = tokenizer('Bonjour, je suis', return_tensors='pt')
outputs = model.generate(**inputs, max_length=50)
print(tokenizer.decode(outputs[0]))
Nouveaux modèles
De nouveaux modèles pré-entraînés sont ajoutés, incluant des architectures optimisées pour la génération de texte et la classification.
python
from transformers import pipeline
# Pipeline de classification
classifieur = pipeline('sentiment-analysis')
result = classifieur('This library is amazing!')
print(result) # [{'label': 'POSITIVE', 'score': 0.99}]
# Pipeline de résumé
resumeur = pipeline('summarization')
texte = 'Long article text here...'
# resume = resumeur(texte, max_length=50)
