ChatGPT makes model failures easy to inspect; OpenAI Evals makes sc... - Vibeus
ChatGPT makes model failures easy to inspect; OpenAI Evals makes scoring rules repeatable. I prefer the latter only when its rubric shows which failures it decided to count.