Vue d'ensemble

Transformers 4.33, publié le 20 septembre 2023, ajoute le support de Llama 2 et améliore la quantification des modèles.

Fonctionnalités principales

Support Llama 2

Les modèles Llama 2 de Meta sont intégrés nativement, permettant l’inférence et le fine-tuning directement.

python
from transformers import pipeline

gen = pipeline(
    'text-generation',
    model='meta-llama/Llama-2-7b-chat-hf',
    device_map='auto',
)
result = gen('Bonjour, comment', max_new_tokens=50)
print(result[0]['generated_text'])

Quantification améliorée

Le support de GPTQ et bitsandbytes permet de charger des modèles en 4 bits, réduisant la mémoire GPU nécessaire.

python
from transformers import AutoModelForCausalLM, BitsAndBytesConfig

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
    bnb_4bit_compute_dtype='float16',
)
model = AutoModelForCausalLM.from_pretrained(
    'meta-llama/Llama-2-7b-hf',
    quantization_config=bnb_config,
    device_map='auto',
)

Sources