Vue d'ensemble

PySpark 3.5, publié le 16 septembre 2023, active les UDFs Arrow par défaut et ajoute le support de Spark Connect.

Fonctionnalités principales

Arrow UDFs par défaut

Les UDFs Pandas utilisent désormais Apache Arrow par défaut pour le transfert de données, offrant des performances bien meilleures.

python
from pyspark.sql import SparkSession
from pyspark.sql.functions import pandas_udf
import pandas as pd

spark = SparkSession.builder.getOrCreate()

@pandas_udf('double')
def doubler(s: pd.Series) -> pd.Series:
    return s * 2  # Arrow transfert par défaut

Spark Connect

Spark Connect permet de se connecter à un cluster Spark distant via une API légère, sans démarrer une JVM locale.

python
from pyspark.sql import SparkSession

# Connexion distante via Spark Connect
spark = (
    SparkSession.builder
    .remote('sc://cluster:15002')
    .getOrCreate()
)
df = spark.sql('SELECT 1 AS id')
df.show()

Sources