Vue d'ensemble
PySpark 3.2, publié le 14 octobre 2021, intègre Koalas sous pyspark.pandas pour une API Pandas sur Spark.
Fonctionnalités principales
pyspark.pandas (Koalas)
L'API Koalas est intégrée comme pyspark.pandas, permettant d'utiliser la syntaxe familière de Pandas sur des données distribuées Spark.
python
import pyspark.pandas as ps
# API Pandas sur Spark
df = ps.DataFrame({
'nom': ['Alice', 'Bob', 'Charlie'],
'age': [30, 25, 35],
})
# Opérations Pandas familières
print(df.describe())
print(df.groupby('nom').mean())
Conversion Pandas/Spark
La conversion entre DataFrames Pandas et Spark est simplifiée, permettant de basculer entre les deux API selon les besoins.
python
import pyspark.pandas as ps
import pandas as pd
# Pandas -> pyspark.pandas
pdf = pd.DataFrame({'a': [1, 2, 3]})
psdf = ps.from_pandas(pdf)
# pyspark.pandas -> Pandas
back_to_pandas = psdf.to_pandas()
print(type(back_to_pandas)) # pandas.DataFrame
