Generate acceptance criteria for agent outcomes from task goal, risk tier, evidence needs, and user approval