145 results in Identity, Observability, Evals, Memory · page 6 of 7
Harness Claude Code Cursor Codex Gemini OpenCode clawsouls Use when you would rather install a ready-made agent persona than write one, and want it to work across OpenClaw, Claude Code and Cursor.
72.8 21 stars · 2 forks
Harness claude codex cursor gemini opencode
cp138-seed identity
kanoniv-agent-auth Use when authority must be handed down a chain of agents and each hop stays provable.
72.7 15 stars · 4 forks
Harness claude codex cursor gemini opencode
cp138-seed identity
clawsouls-soulspec Use when you want one file to define an agent's persistent identity in a way any compatible runtime can load.
69.7 21 stars · 1 fork
Harness claude codex cursor gemini opencode
cp138-seed identity
humanloop-evals Humanloop Python SDK with integrated evals, dataset versioning, and human + LLM judge scoring for production pipelines.
69.0 12 stars · 3 forks
Harness claude cursor codex opencode gemini
evals human-eval dataset sdk
intelliger-ai-oati Use when an agent's authority, and every action it took under that authority, must be verifiable after the fact.
64.8 13 stars · 1 fork
Harness claude codex cursor gemini opencode
cp138-seed identity
wikimem Use to give an agent a queryable wiki knowledge base when memory should be a navigable knowledge graph, not just a flat log: ingest files, folders, and URLs into a linked vault, then search or ask it in natural language.
63.4 7 stars · 4 forks
Harness claude
memory knowledge-base wiki ingest
chrisdbaldwin-masques Use when an agent needs to put on a temporary role — a bundle of intent, context and lens — for one task and take it off afterwards.
59.8 14 stars
Harness claude codex cursor gemini opencode
cp138-seed identity
imphillip-soultavern Use when you have character cards from the roleplay ecosystem and want them as SOUL.md personas an agent runtime can load.
59.0 13 stars
Harness claude codex cursor gemini opencode
cp138-seed identity
sunilp-aip Use when an agent's identity must carry across both MCP and agent-to-agent calls under one delegable scheme.
58.1 6 stars · 2 forks
Harness claude codex cursor gemini opencode
cp138-seed identity
amirf194-wingfoot Use when your agent keeps getting blocked by sites and you need it to present a verifiable bot identity and be told why it failed.
57.2 7 stars · 1 fork
Harness claude codex cursor gemini opencode
cp138-seed identity
paymanai-sigilum Use when an agent's identity has to leave an auditable trail rather than just gate a request.
54.8 9 stars
Harness claude codex cursor gemini opencode
cp138-seed identity
omnidotdev-persona-json Use when a non-human actor needs a portable, machine-readable identity document that travels with it between systems.
38.4 3 stars
Harness claude codex cursor gemini opencode
cp138-seed identity
agentbench Use to put a number on harness quality: run an agent harness against a task set and get a score, so harness changes are validated by evidence. It is the eval backbone of a self-improving loop.
Unranked No signals yet
Harness claude codex
eval benchmark scoring harness
datadog-llm-observability Datadog's managed LLM Observability product. It traces LLM calls, monitors prompt/completion quality, detects anomalies, and integrates with existing APM.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability managed apm
evals-cookbooks OpenAI Cookbook eval recipes: task-specific templates for summarization, QA, and classification evaluation using the Evals framework.
Unranked No signals yet
Harness claude cursor codex opencode gemini
evals cookbook templates openai
fiddler-ai Fiddler AI Observability platform monitors LLM applications for hallucinations, toxicity, bias, and drift, with explainability and alerting for production AI.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability managed safety
gaia-benchmark GAIA: benchmark of 466 real-world questions requiring multi-step reasoning, web browsing, and tool use for general AI assistants.
Unranked No signals yet
Harness claude cursor codex opencode gemini
evals benchmark agents tool-use
honeyhive LLM evaluation and experimentation platform with session tracing, dataset management, and metric-based run comparison.
Unranked No signals yet
Harness claude cursor codex opencode gemini
evals experiment-tracking tracing dataset
honeyhive HoneyHive is an AI evaluation and observability platform for tracing agent pipelines, running evaluations, and debugging regressions in production.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability evals tracing
langtrace Open-source, OpenTelemetry-compliant LLM observability tool by Scale3Labs. It traces calls to all major LLM providers and frameworks with a self-hostable UI.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability opentelemetry tracing
literal-ai Literal AI is an observability and evaluation platform for conversational AI. It captures multi-step threads, scores responses, and integrates with Chainlit.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability tracing evals
lunary Open-source LLM observability and prompt management platform. It tracks conversations, errors, costs, and user feedback for production AI applications.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability logging evals
maxim-ai Maxim AI is an evaluation and observability platform for AI agents. It supports multi-step trace analysis, prompt testing, and production quality monitoring.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability evals agents
new-relic-ai-monitoring New Relic AI Monitoring instruments LLM calls end-to-end. It traces model invocations, measures token costs, and surfaces anomalies via the New Relic platform.
Unranked No signals yet
Harness claude cursor codex opencode gemini
observability managed apm
Previous Page 6 of 7 Next
Browse · Armory