Skip to calculator

Stratified Cross-Validation Calculator

Build balanced classification folds, inspect class ratios, compare validation methods, aggregate model metrics, visualize stability, and export practical cross-validation reports for confident decisions quickly.

Calculated report

Cross-validation summary

Review fold balance, stability, risks, and exportable results.

Distribution

Dataset and holdout allocation

Counts and percentages show the data available before fold creation.

ClassTotalOriginal %Holdout testCV poolCV pool %
Fold details

Training and validation distribution

Each row represents one fold or stratified shuffle split.

Show assigned sample indexes

            
Comparison

Stratified versus standard K-Fold

Lower deviation means validation folds follow the original class ratios more closely.

MethodMean class-ratio deviationMaximum deviationEmpty class-fold cellsInterpretation
Performance

Aggregated metric results

Statistics use the fold-level values entered below.

MetricCountMeanMedianMinimumMaximumRangeStd. deviationVarianceStd. errorConfidence intervalCVBest foldWorst fold
Class evaluation

Combined confusion matrix and class metrics

Precision, recall, and F1-score are calculated from optional confusion counts.

Visual review

Charts

Use the charts to inspect balance, deviation, performance, and repetition stability.

Original class distribution

Validation classes by fold

Training versus validation size

Class-ratio deviation

Fold metric performance

Metric confidence intervals

Repetition stability

Portable output

Merged report data

Copy this text into notes, experiments, or model documentation.


        
Step 1

Choose the dataset source

Enter class frequencies manually or import labels from CSV data.

Required when percentages are entered.

Class frequencies

Step 2

Configure cross-validation

Choose the splitting method, fold count, repeat count, and holdout policy.

%
Step 3

Add fold-level performance metrics

Paste a header row followed by one row per fold. Missing values are allowed.

AccuracyPrecisionRecallSpecificityF1Balanced accuracyROC-AUCLog lossMCCCohen kappaCustom
Use commas, tabs, semicolons, or spaces. Values may be decimals or percentages.
Step 4

Add optional confusion counts

Use one line per cell: fold, actual class, predicted class, count.

Fold names may be numbers or labels. Class names must match the dataset labels.
Examples

Load example data

Use a preset, then adjust any value before calculating.

Formula used

Core calculations

These formulas summarise fold sizing and score variability.

Validation samples per fold ≈ N ÷ K
N is the cross-validation sample count. K is the fold count.
Class samples per fold ≈ Nc ÷ K
Nc is the sample count for one class.
Mean score = Σsi ÷ K
si is the score from fold i.
Sample standard deviation = √[Σ(si − mean)² ÷ (K − 1)]
A larger value indicates less stable validation performance.
Standard error = standard deviation ÷ √K
Confidence intervals use the selected confidence level.
How to use

Calculation steps

  1. Enter class counts, percentages, or CSV labels.
  2. Choose the validation method and fold count.
  3. Set repeats, shuffling, seed, and holdout percentage.
  4. Optionally paste fold metrics and confusion counts.
  5. Calculate, inspect warnings, compare methods, and export.
Example data

Common classification scenarios

ScenarioClass countsSuggested foldsMain concern
Balanced binary50, 505 or 10General stability
Imbalanced binary24, 4765Minority representation
Three classes120, 75, 455Multi-class balance
Small minority4, 196At most 4Empty minority folds
Repeated validation90, 60, 305 repeatedVariance estimation
Ten-fold example130, 17010Smaller validation folds
Learning guide

Important cross-validation practices

Stratification preserves class proportions across validation folds. It is especially useful for imbalanced classification datasets. It does not repair weak labels or leakage.

Fit preprocessing inside every training fold only. This includes scaling, selection, encoding, and resampling. Applying them globally can inflate validation scores.

Group-aware data needs grouped stratification methods. Multilabel targets need iterative multilabel stratification. Ordinary stratification may separate related samples incorrectly.

Leave-one-out classification can produce unstable class coverage. Repeated stratification usually estimates variability more clearly. Use an untouched test set for final reporting.

Frequently asked questions

Stratified cross-validation questions

What does stratified cross-validation preserve?

It keeps each fold close to the dataset’s class proportions.

How many folds should I use?

Five or ten folds are common. The smallest class limits the safe maximum.

What happens when a class has fewer samples than folds?

Some validation folds cannot contain that class. Reduce the fold count.

Should I shuffle before splitting?

Usually yes, unless the data order carries time or sequence meaning.

Why use repeated stratified validation?

Repeats reduce dependence on one random split and expose score variance.

Can stratification prevent data leakage?

No. Pipelines and group-aware splitting are still required.

Should oversampling happen before cross-validation?

No. Apply oversampling only inside each training fold.

Can I use this calculator for regression?

Direct class stratification is for classification. Regression requires binned targets or other strategies.

What indicates unstable model performance?

Large standard deviation, wide confidence intervals, and inconsistent fold scores indicate instability.

Related Calculators

K-Fold Cross-Validation CalculatorTraining Accuracy CalculatorOverfitting Detection CalculatorEarly Stopping CalculatorHyperparameter Combination CalculatorGrid Search Combination CalculatorRandom Search Trial CalculatorLearning Curve Calculator

Important Note: All the Calculators listed in this site are for educational purpose only and we do not guarentee the accuracy of results. Please do consult with other sources as well.