CtrlK
BlogDocsLog inGet started
Tessl Logo

testland/ragas-evaluation

Authors and runs Ragas - RAG-pipeline evaluation framework with metrics organized into RAG (Faithfulness, Response Relevancy, Context Precision/Recall, Context Entities Recall, Noise Sensitivity), Natural Language Comparison (Factual Correctness, Semantic Similarity, BLEU/ROUGE/CHRF/Exact Match), Agents/Tool-Use (Topic Adherence, Tool Call Accuracy/F1, Agent Goal Accuracy), General Purpose (Aspect Critic, Rubrics-based Scoring), Nvidia (Answer Accuracy, Context Relevance, Response Groundedness), and Summarization. Use when the user evaluates a RAG pipeline (retriever + generator) and needs the deepest metric variety in the OSS LLM-eval space.

80

Quality

100%

Does it follow best practices?

Run evals on this skill

Adds up to 20 points to the overall score

View guide

SecuritybySnyk

Low

Low-risk findings worth noting

Overview
Quality
Evals
Security
Files

metrics.mdreferences/

Ragas built-in metric catalog

Source: docs.ragas.io/en/stable/concepts/metrics/available_metrics/. Pick 3 - 5 metrics per pipeline; running all 30+ on every PR blows up cost and latency.

Retrieval Augmented Generation

MetricUse
Context PrecisionAre the relevant chunks ranked high in the retrieved context?
Context RecallDoes the retrieved context contain ground-truth info?
Context Entities RecallEntity-level recall vs ground truth
Noise SensitivityDoes irrelevant context degrade output quality?
Response RelevancyDoes the response address the question?
FaithfulnessAre the response's claims grounded in retrieved context?
Multimodal FaithfulnessFaithfulness for text+image RAG
Multimodal RelevanceRelevance for text+image RAG

Nvidia Metrics

MetricUse
Answer AccuracyNvidia-blessed accuracy scoring
Context RelevanceRelevance scoring with Nvidia methodology
Response GroundednessGroundedness in retrieved context

Agents/Tool Use

MetricUse
Topic AdherenceDoes the agent stay on topic?
Tool Call AccuracyDid it call the right tool?
Tool Call F1F1 score for tool selection
Agent Goal AccuracyDid the agent achieve the user's goal?

Natural Language Comparison

MetricUse
Factual CorrectnessCompares response facts vs ground truth
Semantic SimilarityEmbedding-based similarity to reference
Non LLM String SimilarityString-distance metrics (no LLM call)
BLEU Score / ROUGE Score / CHRF ScoreClassical NLP metrics
String PresenceToken presence check
Exact MatchStrict equality

SQL

MetricUse
Execution-based Datacompy ScoreRun query, compare result-sets
SQL Query EquivalenceSemantic equivalence (different SQL, same result)

General Purpose

MetricUse
Aspect CriticYes/no LLM-judge on a custom aspect
Simple Criteria ScoringNumeric scoring against a rubric
Rubrics-based ScoringMulti-criterion rubric scoring
Instance-specific Rubrics ScoringPer-row rubric variation

Other

MetricUse
SummarizationSummary quality scoring

references

SKILL.md

tile.json