• Research and improve LLM behavior for real-time voice conversations
• Design and run fine-tuning experiments across data, model, and evaluation strategies
• Build evaluation frameworks for model quality, workflow-following, naturalness, reliability, task completion, and overall conversation quality
• Analyze production conversations to find failure modes and opportunities to improve
• Develop data curation, labeling, and synthetic data strategies
• Compare model architectures, training approaches, prompts, and datasets
• Investigate regressions and explain clearly why model behavior improves or degrades
• Work with engineering to deploy research improvements safely and efficiently
• Help define model release criteria, eval gates, and quality benchmarks