Vue d'ensemble
PySpark 3.5, publié le 16 septembre 2023, active les UDFs Arrow par défaut et ajoute le support de Spark Connect.
Fonctionnalités principales
Arrow UDFs par défaut
Les UDFs Pandas utilisent désormais Apache Arrow par défaut pour le transfert de données, offrant des performances bien meilleures.
python
from pyspark.sql import SparkSession
from pyspark.sql.functions import pandas_udf
import pandas as pd
spark = SparkSession.builder.getOrCreate()
@pandas_udf('double')
def doubler(s: pd.Series) -> pd.Series:
return s * 2 # Arrow transfert par défaut
Spark Connect
Spark Connect permet de se connecter à un cluster Spark distant via une API légère, sans démarrer une JVM locale.
python
from pyspark.sql import SparkSession
# Connexion distante via Spark Connect
spark = (
SparkSession.builder
.remote('sc://cluster:15002')
.getOrCreate()
)
df = spark.sql('SELECT 1 AS id')
df.show()
