Evaluation Layer¶
The evaluate layer runs evaluators against a captured DatasetRunOutput and
produces an EvaluationOutput with runs / cases DataFrames.
This layer has no MLflow server dependency — it is pure in the sense that it consumes dataclass inputs and returns dataclass outputs. This makes evaluation easy to unit-test without any external infrastructure.
evaluate_results¶
ragpill.evaluation.evaluate_results
async
¶
Run evaluators against a captured :class:DatasetRunOutput.
For every (case, task_run) pair, builds an
:class:~ragpill.eval_types.EvaluatorContext with the captured trace and
runs every case-level + dataset-level evaluator. Results are aggregated
per case using threshold from settings (or per-case override).
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
dataset_run
|
DatasetRunOutput
|
Output of :func: |
required |
testset
|
Dataset[Any, Any, CaseMetadataT]
|
The dataset whose cases align one-for-one with
|
required |
settings
|
MLFlowSettings | None
|
Global :class: |
None
|
Returns:
| Type | Description |
|---|---|
EvaluationOutput
|
class: |
EvaluationOutput
|
|
Example
See Also
execute_dataset: Phase 1.
upload_to_mlflow: Phase 3.
Source code in src/ragpill/evaluation.py
308 309 310 311 312 313 314 315 316 317 318 319 320 321 322 323 324 325 326 327 328 329 330 331 332 333 334 335 336 337 338 339 340 341 342 343 344 345 346 347 348 349 350 351 352 353 354 355 356 357 358 359 360 361 362 363 364 365 366 367 368 369 370 371 372 373 374 375 376 377 378 379 380 381 382 383 384 385 386 387 388 389 390 391 | |
See Also¶
- Execution Layer — produce the
DatasetRunOutputthis layer consumes. - Upload Layer — persist the
EvaluationOutputproduced here. - Layered Architecture Guide.
- Result Types —
EvaluationOutput,CaseResult,RunResult, etc.