Набор скиллов для оценки LLM-агентов и LLM-приложений: классификация, рубрики, согласие оценщиков, отчёты
-
Updated
Jul 16, 2026 - Python
Набор скиллов для оценки LLM-агентов и LLM-приложений: классификация, рубрики, согласие оценщиков, отчёты
Model-agnostic AI response evaluation handbook with evidence-based rubrics, calibration guides, case studies, and reusable templates
Provider-neutral AI evaluation toolkit for reusable test cases, regression datasets, provider adapters, deterministic and LLM judges, agent trajectory and security evaluation, statistical analysis, quality/cost/latency trade-offs, online experiments, evidence guardrails, and release gates.
To associate your repository with the evaluation-rubrics topic, visit your repo's landing page and select "manage topics."