Skip to main content

Core Principles

ATLAS evaluation verifies that the adaptive dual-agent loop (student + verifying teacher) improves outcomes without degrading performance for capable students. The framework measures both quantitative metrics and qualitative guidance effectiveness.

Non-Degradation

Ensure teaching never harms performance (≥97% safety rate)

Efficiency

Measure token reduction and speed improvements

Generalization

Validate across diverse tasks and model scales

Evaluation Protocol

Two-Pass Comparison Framework

1

Baseline Measurement

Run student model independently on evaluation tasks:
2

Dual-Agent Evaluation

Apply ATLAS two-pass protocol:
3

Performance Comparison

Calculate improvement metrics:

Non-Degradation Verification

Critical safety metric ensuring teaching never makes performance worse:

Efficiency Metrics

Comprehensive measurement of resource utilization:

Evaluation Commands

Full Benchmark Suite

Complete evaluation with detailed logging:

Quick Validation

Rapid testing for development iterations:

Production Evaluation

Full-scale testing with statistical validation:

Data Collection Framework

Quantitative Metrics

  • Accuracy improvements vs baseline
  • Task completion rates
  • Per-category performance breakdown
  • Statistical significance (p-values)

Qualitative Analysis

Systematic review of teaching quality:
  1. Diagnostic Accuracy: How well does the probe identify capability gaps?
  2. Teaching Relevance: Is guidance targeted to identified weaknesses?
  3. Adaptation Quality: Does teaching adjust to student skill level?
  4. Failure Patterns: What causes degradation or teaching failures?

Statistical Validation

Significance Testing

All results require statistical validation:

Sample Size Requirements

Expected Outcomes

Successful evaluation demonstrates:

Closed-Loop Accuracy

+15–30% lift with the dual-agent runtime (student + verifying teacher)

Offline GRPO

Sustained improvements by training on exported runtime traces

Completion

~100% vs ~69% baseline

Efficiency

~50% token reduction with teaching

Error Analysis Framework

Failure Mode Categorization

Diagnostic Accuracy

Measure probe effectiveness:

Scalability Testing

Model Size Scaling

Infrastructure Scaling

Reproducibility Requirements

  • Training logs (wandb or tensorboard)
  • Metric summaries (JSON format)
  • Representative examples (10% sampling)
  • Configuration files (complete YAML)

Next Steps

Reproduction Guide

Reproduce our findings

Run Evaluation

Start your evaluation