Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

0 stars 0 forks 0 watchers Python Apache License 2.0
benchmarking calibration classification cli confidence-calibration evaluation expected-calibration-error llm machine-learning model-evaluation python uncertainty-quantification
15 Open Issues Need Help Last updated: Sep 22, 2026

Open Issues Need Help

View All on GitHub

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification
docs good first issue

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification
docs good first issue

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification
bug good first issue ci

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification
bug good first issue

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification
bug good first issue

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification
docs good first issue adapter

Measure whether a decision model's probabilities hold up on your own labeled data. Not a leaderboard.

Python
#benchmarking#calibration#classification#cli#confidence-calibration#evaluation#expected-calibration-error#llm#machine-learning#model-evaluation#python#uncertainty-quantification