Vue d'ensemble
Transformers 4.44, publié le 15 septembre 2024, ajoute le support du format GGUF pour charger des modèles quantifiés efficacement.
Fonctionnalités principales
Support GGUF
Le format GGUF permet de charger des modèles quantifiés (Q4, Q8) directement dans Transformers, réduisant l'empreinte mémoire pour l'inférence locale.
python
from transformers import AutoModelForCausalLM, AutoTokenizer
# Chargement d'un modèle GGUF quantifié
model = AutoModelForCausalLM.from_pretrained(
'TheBloke/Llama-2-7B-GGUF',
gguf_file='llama-2-7b.Q4_K_M.gguf',
)
tokenizer = AutoTokenizer.from_pretrained(
'TheBloke/Llama-2-7B-GGUF',
gguf_file='llama-2-7b.Q4_K_M.gguf',
)
print(f'Modèle chargé en GGUF Q4')
