771 packages matching “Evaluations”
architectonic-agents
v0.3.4 · 21 days ago
Agent composition layer for identity, doctrine, skills, models, knowledge, permissions, evaluations, and upkeep.
No known vulnerabilities
@ledgelm/evals
v0.1.0 · 28 days ago
Framework-neutral helpers for running and reporting LLM evaluations
No known vulnerabilities
ponys-ai-benchmark-core
v1.0.0 · 14 days ago
Deterministic scoring and report helpers for multilingual AI companion evaluations.
No known vulnerabilities
ai-coding-benchmark-solutions
v1.0.3 · 10 days ago
Curated reference solutions and solution notes for coding and software-engineering agent benchmarks used in Artificial Analysis intelligence evaluations (Terminal-Bench, SciCode, LiveCodeBench) plus SWE-bench.
No known vulnerabilities
@wix/eval-assertions
v0.84.0 · 1 month ago
Assertion framework for AI agent evaluations - supports skill invocation checks, build validation, and LLM-based judging
No known vulnerabilities
ionic-rating-component
v1.2.1 · 5 years ago
Highly customizable Ionic 5 component to display evaluations or a quick rating operation of something.
No known vulnerabilities
@uipath/access-policy-tool
v1.2.0 · 2 months ago
Manage UiPath Access Policies, rules, and compliance evaluations.
No known vulnerabilities
promptmetrics
v1.5.3 · 3 months ago
Lightweight, self-hosted prompt registry with versioning, metadata logging, evaluations, and multi-tenant observability
No known vulnerabilities
ai-model-benchmark-solutions
v1.0.3 · 10 days ago
Curated reference solutions and solution notes for Artificial Analysis Intelligence Index and additional evaluations, plus cybersecurity/agent benchmarks (ExploitGym, CVE-Bench, and peers) and broader agent evals (GAIA, WebArena).
No known vulnerabilities
@gigaflow/client
v0.1.1 · 15 days ago
The GigaFlow control plane: evaluations, datasets, feedback, and durable subject outcomes.
No known vulnerabilities
@trohde/earos
v1.8.7 · 4 months ago
Schema-driven editor and CLI for EaROS architecture assessment rubrics and evaluations
No known vulnerabilities
@poolsideai/pooleval
v0.0.1 · 3 months ago
Eval charts for Svelte — animated, themeable bar charts for showing model evaluations.
No known vulnerabilities
@rotalabs/comply
v0.0.2 · 1 month ago
Compliance evaluations for AI agents
No known vulnerabilities
@inkeep/agents-eval-api
v0.32.0 · 7 months ago
Agents Evaluation API for Inkeep Agent Framework - handles evaluations, datasets, and evaluation runs
No known vulnerabilities
@twilio-alpha/assistants-eval
v0.1.1 · 1 year ago
promptfoo extension for writing AI evaluations for Twilio AI Assistants
No known vulnerabilities
@joacotee94/sdk
v3.0.0 · 6 years ago
SDK used to call evaluations function
No known vulnerabilities
horizon-eval-sdk
v1.0.8 · 1 year ago
Node.js SDK for Horizon Evaluations
No known vulnerabilities
@ankurpm/evalschool
v1.0.8 · 6 months ago
Interactive CLI for learning LLM evaluations - like Gemini CLI but for evals
No known vulnerabilities
evaluations
v0.1.1 · 5 months ago
Evaluations - Open infrastructure for AI agents
No known vulnerabilities
@oscharko-dev/keiko-evaluations
v0.2.11 · 1 month ago
Internal evaluations package: deterministic evaluation harness — scripted ModelPort fixtures, six scored dimensions, surface-parity check, scorecard renderer, and the offline-vs-live model provider selector (ADR-0012, ADR-0019). Not published independentl
No known vulnerabilities