Related terms
A metric that measures whether an AI system's output is factually accurate, logically valid, and satisfies the intended task or expected result.
RelevanceA performance metric that measures how pertinent and applicable generated outputs or retrieved results are to the query.
CompletenessA metric that measures how fully an AI response covers the required information, tasks, or expected outputs for a given request.
Human EvaluationAn evaluation method in which human reviewers assess the quality of AI system outputs against defined criteria such as correctness, relevance, helpfulness, safety, or fluency, providing judgments that complement or validate automated evaluation metrics.