Le backend PyArrow

Pandas 2.0 permet d'utiliser PyArrow comme backend de stockage via dtype_backend='pyarrow'. Les types Arrow offrent une meilleure gestion des valeurs manquantes, des chaînes de caractères plus efficaces et une interopérabilité native avec l'écosystème Arrow.

Utilisation

python
import pandas as pd

# Lire un CSV avec le backend PyArrow
df = pd.read_csv(
    'donnees.csv',
    dtype_backend='pyarrow',
    engine='pyarrow',
)
print(df.dtypes)
# nom      string[pyarrow]
# age      int64[pyarrow]
# salaire  double[pyarrow]

# Avantages :
# - Chaînes de caractères natives (pas d'object dtype)
# - Valeurs manquantes natives (pas de NaN pour les entiers)
# - Mémoire réduite sur les chaînes répétitives
print(df.memory_usage(deep=True))

Sources