Skip to main content
POST
Run evaluation on multiple outputs in a single request. Ideal for batch processing, dataset evaluation, and regression testing. Uses the same 27 built-in metrics as the single evaluation endpoint.
array
required
Array of items to evaluate
array
required
Scorers to apply to all items. Choose from 27 built-in metrics: Custom: playval RAG: answer_relevancy, faithfulness, contextual_precision, contextual_recall, contextual_relevancy Safety: bias, toxicity, non_advice, misuse, pii_leakage, role_violation Agentic: task_completion, tool_correctness, argument_correctness, step_efficiency, plan_adherence, plan_quality Multi-Turn: turn_relevancy, role_adherence, knowledge_retention, conversation_completeness, goal_accuracy, tool_use, topic_adherence, turn_faithfulness, turn_contextual_precision, turn_contextual_recall Or use custom scorer IDs from Create Custom Scorer
object
Batch configuration
string
required
Batch identifier
string
required
Batch status: running, completed, failed
array
required
Per-item evaluation results
object
required
Batch summary statistics