Vue d'ensemble

PyArrow 9.0, publié le 3 août 2022, améliore la lecture et l'écriture de fichiers Parquet avec de nouvelles options de compression.

Fonctionnalités principales

Améliorations Parquet

La lecture Parquet est accélérée avec un meilleur filtrage par prédicat et le support de nouvelles options de compression comme ZSTD.

python
import pyarrow as pa
import pyarrow.parquet as pq

table = pa.table({
    'nom': ['Alice', 'Bob', 'Charlie'],
    'age': [30, 25, 35],
})

# Écriture avec compression ZSTD
pq.write_table(table, 'data.parquet', compression='zstd')

# Lecture avec filtrage
result = pq.read_table('data.parquet', filters=[('age', '>', 28)])
print(result.to_pandas())

Compute enrichi

Le module compute ajoute de nouvelles fonctions de manipulation de chaînes et d'agrégation pour les tableaux Arrow.

python
import pyarrow as pa
import pyarrow.compute as pc

noms = pa.array(['alice dupont', 'bob martin', 'charlie durand'])

# Manipulation de chaînes
upper = pc.utf8_upper(noms)
print(upper)  # ['ALICE DUPONT', ...]

# Extraction de motifs
first_names = pc.utf8_split_whitespace(noms)
print(first_names)

Sources