Build agent evaluation datasets from task type, risk tier, edge cases, expected outputs, and review rubric