Vue d'ensemble
Transformers 4.38, publie le 15 mars 2024, ajoute le support de Gemma et le cache KV quantifie.
Fonctionnalites principales
Support de Gemma
Le modele Gemma de Google est integre nativement dans la bibliotheque.
python
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('google/gemma-2b')
tokenizer = AutoTokenizer.from_pretrained('google/gemma-2b')
inputs = tokenizer('Hello, world!', return_tensors='pt')
outputs = model.generate(**inputs, max_new_tokens=50)
Cache KV quantifie
Le cache cle-valeur peut etre quantifie en int8/int4 pour reduire la memoire lors de l'inference.
python
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
'google/gemma-2b',
device_map='auto',
)
# Le cache KV quantifie reduit l'empreinte memoire
# lors de la generation de longues sequences
