Deep Evaluation Experience
Experienced designing evaluations for LLMs, agents, or other complex AI systems.
Can turn ambiguous quality problems into measurable dimensions, datasets, and experiments.
Familiar with challenges such as grader bias, leakage, misleading aggregate metrics, regression detection, and offline-online mismatch.