Skip to content

latent.stats.models

Pydantic models for statistical evaluation results.

Classes

CalibrationStats

CalibrationStats()

Judge calibration statistics.

CategorySummary

CategorySummary()

Aggregated metrics for one category slice.

ComparisonResult

ComparisonResult()

Result of comparing two systems on a metric.

ConfusionMatrixResult

ConfusionMatrixResult()

Confusion matrix with per-cell CIs.

DriftResult

DriftResult()

Result of drift detection between two eval runs.

FailureModeSummary

FailureModeSummary()

One failure type and its prevalence among failing records.

GatingResult

GatingResult()

Result of checking a metric against a threshold.

MetricResult

MetricResult()

Result of a single metric with confidence interval.

OrdinalDistribution

OrdinalDistribution()

Full distribution of ordinal scores with rubric labels.

OrdinalLevel

OrdinalLevel()

A single level in an ordinal distribution.

PowerAnalysis

PowerAnalysis()

Post-hoc power analysis result.

RecordResult

RecordResult()

Single evaluation record with flexible score columns.

StatisticalReport

StatisticalReport()

Complete statistical evaluation report.

VariantInfo

VariantInfo()

Describes one agent/system variant in a comparison report.