Core Principles
ATLAS evaluation verifies that the adaptive dual-agent loop (student + verifying teacher) improves outcomes without degrading performance for capable students. The framework measures both quantitative metrics and qualitative guidance effectiveness.Non-Degradation
Ensure teaching never harms performance (≥97% safety rate)
Efficiency
Measure token reduction and speed improvements
Generalization
Validate across diverse tasks and model scales
Evaluation Protocol
Two-Pass Comparison Framework
1
Baseline Measurement
Run student model independently on evaluation tasks:
2
Dual-Agent Evaluation
Apply ATLAS two-pass protocol:
3
Performance Comparison
Calculate improvement metrics:
Non-Degradation Verification
Critical safety metric ensuring teaching never makes performance worse:Efficiency Metrics
Comprehensive measurement of resource utilization:Evaluation Commands
Full Benchmark Suite
Complete evaluation with detailed logging:Quick Validation
Rapid testing for development iterations:Production Evaluation
Full-scale testing with statistical validation:Data Collection Framework
Quantitative Metrics
- Performance
- Efficiency
- Robustness
- Accuracy improvements vs baseline
- Task completion rates
- Per-category performance breakdown
- Statistical significance (p-values)
Qualitative Analysis
Systematic review of teaching quality:- Diagnostic Accuracy: How well does the probe identify capability gaps?
- Teaching Relevance: Is guidance targeted to identified weaknesses?
- Adaptation Quality: Does teaching adjust to student skill level?
- Failure Patterns: What causes degradation or teaching failures?
Statistical Validation
Significance Testing
All results require statistical validation:Sample Size Requirements
Expected Outcomes
Successful evaluation demonstrates:Closed-Loop Accuracy
+15–30% lift with the dual-agent runtime (student + verifying teacher)
Offline GRPO
Sustained improvements by training on exported runtime traces
Completion
~100% vs ~69% baseline
Efficiency
~50% token reduction with teaching
Error Analysis Framework
Failure Mode Categorization
Diagnostic Accuracy
Measure probe effectiveness:Scalability Testing
Model Size Scaling
Infrastructure Scaling
Reproducibility Requirements
Environment Specification
Environment Specification
Configuration Documentation
Configuration Documentation
Artifact Preservation
Artifact Preservation
- Training logs (
wandbortensorboard) - Metric summaries (JSON format)
- Representative examples (10% sampling)
- Configuration files (complete YAML)
Next Steps
Reproduction Guide
Reproduce our findings
Run Evaluation
Start your evaluation