Vue d'ensemble
Ray 2.5, publié le 15 juin 2023, améliore Ray Data pour le traitement de données distribuées à grande échelle.
Fonctionnalités principales
Ray Data amélioré
Ray Data offre une API de haut niveau pour le traitement de données distribuées, avec un support amélioré des sources de données et des transformations.
python
import ray
ray.init()
ds = ray.data.read_parquet('s3://bucket/donnees/')
ds = ds.filter(lambda row: row['score'] > 80)
ds = ds.map(lambda row: {
**row,
'categorie': 'excellent' if row['score'] > 90 else 'bon'
})
print(ds.count())
Intégration ML améliorée
L'intégration avec les frameworks ML (PyTorch, TensorFlow) est simplifiée pour le prétraitement de données distribué.
python
import ray
ds = ray.data.read_images('s3://bucket/images/')
def pretraiter(lot):
lot['image'] = [img / 255.0 for img in lot['image']]
return lot
ds = ds.map_batches(pretraiter)
print(f'Images : {ds.count()}')
