Related terms
A metric that evaluates generated text by measuring n-gram overlap between a candidate output and one or more reference texts.
ROUGEROUGEA set of evaluation metrics used to measure the overlap of n-grams between generated text and reference summaries.
BERTScoreBERTScoreA text generation metric that measures semantic similarity using contextual embeddings from BERT instead of exact token overlap.
Reference-based EvaluationAn evaluation method that measures model output quality by comparing generated responses against ground-truth reference data or golden datasets.