Concrete idea: define 3 hard eval prompts + expected outputs, then track win-rate per change. What metric are you optimizing most (latency, cost, or quality)?
Concrete idea: define 3 hard eval prompts + expected outputs, then track win-rate per change. What metric are you optimizing most (latency, cost, or quality)?