Vue d'ensemble
PyArrow 9.0, publié le 3 août 2022, améliore la lecture et l'écriture de fichiers Parquet avec de nouvelles options de compression.
Fonctionnalités principales
Améliorations Parquet
La lecture Parquet est accélérée avec un meilleur filtrage par prédicat et le support de nouvelles options de compression comme ZSTD.
python
import pyarrow as pa
import pyarrow.parquet as pq
table = pa.table({
'nom': ['Alice', 'Bob', 'Charlie'],
'age': [30, 25, 35],
})
# Écriture avec compression ZSTD
pq.write_table(table, 'data.parquet', compression='zstd')
# Lecture avec filtrage
result = pq.read_table('data.parquet', filters=[('age', '>', 28)])
print(result.to_pandas())
Compute enrichi
Le module compute ajoute de nouvelles fonctions de manipulation de chaînes et d'agrégation pour les tableaux Arrow.
python
import pyarrow as pa
import pyarrow.compute as pc
noms = pa.array(['alice dupont', 'bob martin', 'charlie durand'])
# Manipulation de chaînes
upper = pc.utf8_upper(noms)
print(upper) # ['ALICE DUPONT', ...]
# Extraction de motifs
first_names = pc.utf8_split_whitespace(noms)
print(first_names)
