Machine Learning Β· Chapter 35 of 40
Pipelines
A PIPELINE chains preprocessing and modeling into one object. Prevents data leakage and simplifies deployment.
Use `ColumnTransformer` to apply different steps to different columns.
Example 1 (python)
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.linear_model import LogisticRegression
p = Pipeline([('sc', StandardScaler()), ('lr', LogisticRegression())])
p.fit(X_train, y_train)Scale then model β one call.
Example 2 (python)
# ColumnTransformer for mixed feature types
from sklearn.compose import ColumnTransformerDifferent preprocessing per column set.
Key points
- Chain preprocessing + model.
- Prevents data leakage in CV.
- One object to serialize.
- Use ColumnTransformer for mixed types.
π‘ Note: Grid searching hyperparameters of any step is possible via `pipeline.set_params(step__param=value)`.
