Analysis results
| Rank | Class | Support | Prevalence | AP | PR AUC | Best F1 | Best threshold | Vs macro AP | Status |
|---|
| Class | Threshold | Precision | Recall | F1 | Specificity | TP | FP | FN | TN | Predicted positive | Cost |
|---|
Add optional Model B data to compare models.
| Class | Model A AP | Model B AP | AP change | Model A AUC | Model B AUC | AUC change | Winner |
|---|
Data and class setup
Use commas. Names must be unique.
Use a pipe between multilabel actual classes.
Headers may be actual, class names, and weight.
Actual labels and class names should match Model A.
Calculation options
Hold Ctrl or Command to select several.
Chart options
Class display styles
Run and export
Calculating curves0%
Formula used
Precision
Precision measures correct positive predictions. It penalizes false positive decisions.
Precision = TP / (TP + FP)
Recall
Recall measures detected positive examples. It penalizes missed positive observations.
Recall = TP / (TP + FN)
F1 score
F1 balances precision and recall. It uses their harmonic mean.
F1 = 2 × Precision × Recall / (Precision + Recall)
Average Precision: the weighted sum of precision values across recall increases.
PR AUC: trapezoidal integration of precision over recall.
One-versus-rest: each selected class becomes positive. Other classes become negative.
How to use
- Enter unique class names.
- Add actual labels and class probabilities.
- Choose classes, thresholds, costs, and chart settings.
- Calculate the curves and review class summaries.
- Export tables, images, data, or a report.
Example data format
| actual | Cat | Dog | Bird | weight |
|---|---|---|---|---|
| Cat | 0.82 | 0.12 | 0.06 | 1 |
| Dog | 0.18 | 0.70 | 0.12 | 1 |
| Bird | 0.09 | 0.21 | 0.70 | 1 |
Frequently asked questions
- What does each curve represent?
- Each curve treats one class as positive and others as negative.
- Why use precision-recall curves?
- They are especially useful when positive classes are rare or imbalanced.
- What is Average Precision?
- Average Precision summarizes precision across increasing recall levels.
- Is PR AUC identical to Average Precision?
- No. This calculator reports both integration methods separately.
- What is the no-skill baseline?
- It equals the positive prevalence for the evaluated class.
- What does micro-average mean?
- It pools every one-versus-rest decision before computing one curve.
- What does macro-average mean?
- It gives equal influence to every selected class.
- What does weighted-average mean?
- It weights class performance using each class support.
- What does samples-average mean?
- It averages label-ranking precision separately across observations.
- Can I use multilabel targets?
- Yes. Select multilabel mode and separate actual labels with pipes.
- Can I compare two models?
- Yes. Enable Model B and paste matching prediction data.