231 results in Identity, Evals, CLIs & Tools · page 10 of 10
Harness Claude Code Cursor Codex Gemini OpenCode agent-booster Use to apply deterministic, zero-LLM code transforms: fast, repeatable edits that don't need a model, so an agent offloads mechanical changes to a cheap tool instead of spending tokens reasoning through them.
Unranked No signals yet
Harness claude codex cursor
code-transform deterministic zero-llm tooling
skillsmith Use to author, test, and share agent skills from the command line: scaffold a SKILL.md, validate its structure, and package it for reuse, turning a one-off procedure into a portable capability.
Unranked No signals yet
Harness claude codex
skills authoring cli sharing
a2a-test Testing implementation for A2A protocol
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tools
a2a-learning Repository for learning and mastering the A2A protocol
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tools
a2a-code-along Code along examples for A2A
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tools
claude-code-chat An elegant and user-friendly Claude Code chat interface for VS Code.
Unranked No signals yet
Harness claude
claude-code tooling
claude-swarm Launch Claude Code session that is connected to a swarm of Claude Code Agents.
Unranked No signals yet
Harness claude
claude-code tooling
evals-cookbooks OpenAI Cookbook eval recipes: task-specific templates for summarization, QA, and classification evaluation using the Evals framework.
Unranked No signals yet
Harness claude cursor codex opencode gemini
evals cookbook templates openai
gaia-benchmark GAIA: benchmark of 466 real-world questions requiring multi-step reasoning, web browsing, and tool use for general AI assistants.
Unranked No signals yet
Harness claude cursor codex opencode gemini
evals benchmark agents tool-use
honeyhive LLM evaluation and experimentation platform with session tracing, dataset management, and metric-based run comparison.
Unranked No signals yet
Harness claude cursor codex opencode gemini
evals experiment-tracking tracing dataset
javascript-cli JavaScript command-line tool for interacting with A2A servers
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tools
official-a2a-repository official A2A repository
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent clients
orchestrator-agent An agent that can delegate tasks to remote agents through A2A
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tools
patronus-ai Automated LLM evaluation and hallucination detection platform with a Python SDK and judge-model scoring.
Unranked No signals yet
Harness claude cursor codex opencode gemini
evals hallucination judge sdk
python-cli Command-line tool to interact with A2A servers
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tools
Previous Page 10 of 10
Browse · Armory