Vue d'ensemble

Ray 2.5, publié le 15 juin 2023, améliore Ray Data pour le traitement de données distribuées à grande échelle.

Fonctionnalités principales

Ray Data amélioré

Ray Data offre une API de haut niveau pour le traitement de données distribuées, avec un support amélioré des sources de données et des transformations.

python
import ray

ray.init()

ds = ray.data.read_parquet('s3://bucket/donnees/')
ds = ds.filter(lambda row: row['score'] > 80)
ds = ds.map(lambda row: {
    **row,
    'categorie': 'excellent' if row['score'] > 90 else 'bon'
})
print(ds.count())

Intégration ML améliorée

L'intégration avec les frameworks ML (PyTorch, TensorFlow) est simplifiée pour le prétraitement de données distribué.

python
import ray

ds = ray.data.read_images('s3://bucket/images/')

def pretraiter(lot):
    lot['image'] = [img / 255.0 for img in lot['image']]
    return lot

ds = ds.map_batches(pretraiter)
print(f'Images : {ds.count()}')

Sources