Vue d'ensemble

Transformers 4.38, publie le 15 mars 2024, ajoute le support de Gemma et le cache KV quantifie.

Fonctionnalites principales

Support de Gemma

Le modele Gemma de Google est integre nativement dans la bibliotheque.

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained('google/gemma-2b')
tokenizer = AutoTokenizer.from_pretrained('google/gemma-2b')

inputs = tokenizer('Hello, world!', return_tensors='pt')
outputs = model.generate(**inputs, max_new_tokens=50)

Cache KV quantifie

Le cache cle-valeur peut etre quantifie en int8/int4 pour reduire la memoire lors de l'inference.

python
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained(
    'google/gemma-2b',
    device_map='auto',
)
# Le cache KV quantifie reduit l'empreinte memoire
# lors de la generation de longues sequences

Sources