from sklearn.preprocessing import StandardScaler scaler = StandardScaler() X_scaled = scaler.fit_transform(X_train) X_test_scaled = scaler.transform(X_test) Why is it critical to use transform instead of fit_transform on the test set?

Data Science Hard

Data Science — Hard

from sklearn.preprocessing import StandardScaler scaler = StandardScaler() X_scaled = scaler.fit_transform(X_train) X_test_scaled = scaler.transform(X_test) Why is it critical to use transform instead of fit_transform on the test set?

Key points

  • Fit on training data only
  • Transform test data using training parameters
  • Data leakage leads to over-optimistic performance

Ready to go further?

Related questions