Le backend PyArrow
Pandas 2.0 permet d'utiliser PyArrow comme backend de stockage via dtype_backend='pyarrow'. Les types Arrow offrent une meilleure gestion des valeurs manquantes, des chaînes de caractères plus efficaces et une interopérabilité native avec l'écosystème Arrow.
Utilisation
python
import pandas as pd
# Lire un CSV avec le backend PyArrow
df = pd.read_csv(
'donnees.csv',
dtype_backend='pyarrow',
engine='pyarrow',
)
print(df.dtypes)
# nom string[pyarrow]
# age int64[pyarrow]
# salaire double[pyarrow]
# Avantages :
# - Chaînes de caractères natives (pas d'object dtype)
# - Valeurs manquantes natives (pas de NaN pour les entiers)
# - Mémoire réduite sur les chaînes répétitives
print(df.memory_usage(deep=True))
