Vue d'ensemble

Dask 2024.6, publié le 15 juin 2024, apporte des améliorations de performance pour le traitement distribué de données volumineuses.

Fonctionnalités principales

Optimisations de performance

Le planificateur distribué bénéficie d'optimisations mémoire et de meilleurs algorithmes de partitionnement pour les DataFrames.

python
import dask.dataframe as dd

# Lecture distribuée d'un gros fichier
df = dd.read_parquet('donnees/*.parquet')

# Agrégation optimisée
resultat = (
    df.groupby('categorie')
    .agg({'montant': 'sum', 'quantite': 'mean'})
    .compute()
)
print(resultat)

Sources