756 results in Evals, Workflows · page 4 of 32
Harness Claude Code Cursor Codex Gemini OpenCode ai-mocks Mock HTTP/SSE and LLM servers, inspired by wiremock, with response streaming and SSE
82.6 52 stars · 4 forks
Harness claude cursor codex opencode gemini
a2a agent-to-agent frameworks
braintrust Developer platform for logging, evaluating, and comparing LLM experiments with dataset versioning and scoring functions.
82.3 27 stars · 12 forks
Harness claude cursor codex opencode gemini
evals experiment-tracking sdk
awesome-claude-code-output-styles-that-i-really-like A fun and moderately amusing collection of experimental output styles.
81.6 78 stars · 2 forks
Harness claude
output-style
laravel-tall-stack-ai-development-starter-kit Transform your Laravel TALL (Tailwind, AlpineJS, Laravel, Livewire) stack development with comprehensive Claude Code configurations that provide intelligent assistance, systematic workflows, and domain expert consultation.
81.0 41 stars · 4 forks
Harness claude
claude-code workflows-knowledge-guides
linux-desktop-slash-commands A library of slash commands intended specifically to facilitate common and advanced operations on Linux desktop environments (although many would also be useful on Linux servers). Command groups include hardware benchmarking, filesystem organisation, and security posture validation.
80.6 30 stars · 6 forks
Harness claude
claude-code slash-commands
galileo-evaluate Galileo evaluation and observability SDK for detecting hallucinations, data errors, and model weaknesses in LLM pipelines.
80.3 22 stars · 11 forks
Harness claude cursor codex opencode gemini
evals hallucination observability sdk
azure-openai-llm-cookbook A one-stop hub with 100+ Azure OpenAI sample code organized by topic for quick reference
72.0 16 stars · 3 forks
Harness claude cursor codex opencode gemini
a2a agent-to-agent tutorials-learning-resources
humanloop-evals Humanloop Python SDK with integrated evals, dataset versioning, and human + LLM judge scoring for production pipelines.
69.0 12 stars · 3 forks
Harness claude cursor codex opencode gemini
evals human-eval dataset sdk
a2a-walk-through A2A Concept walkthrough
60.6 15 stars
Harness claude cursor codex opencode gemini
a2a agent-to-agent tutorials-learning-resources
agent-rank Documentation about agent ranking
60.6 9 stars · 1 fork
Harness claude cursor codex opencode gemini
a2a agent-to-agent documentation
qredence-agentic-kernel A flexible foundation AI system for creating A2A-compatible autonomous AI agents
59.8 14 stars
Harness claude cursor codex opencode gemini
a2a agent-to-agent frameworks
gen-alpha-slang An output style that makes Claude Code write in Gen Alpha slang, listed for its humour.
59.0 8 stars · 1 fork
Harness claude
output-style
ralph-wiggum-bdd A standalone Bash script for Behavior-Driven Development with Ralph Wiggum Loop. In principle, while running unattended, the script can keep code and requirements in sync, but in practice it still requires interactive human supervision, so it supports both modes. The script is standalone and can be modified and committed into your project.
53.1 8 stars
Harness claude
claude-code workflows-knowledge-guides
a2a-docs-zh Agent2Agent Protocol (A2A) Chinese documentation
53.1 8 stars
Harness claude cursor codex opencode gemini
a2a agent-to-agent documentation
llm-tutorials AI drawing learning guide
38.4 3 stars
Harness claude cursor codex opencode gemini
a2a agent-to-agent tutorials-learning-resources
mcp-o MCP-based orchestration framework
38.4 3 stars
Harness claude cursor codex opencode gemini
a2a agent-to-agent frameworks
claude-code-output-styles-debugging A small set of output styles for debugging: root cause analysis and a systematic, methodical approach to fixing bugs in Claude Code.
38.0 2 stars · 1 fork
Harness claude
claude-code output-styles
agent-hub Keeps AI agents discoverable, composable, and resilient
29.0 1 star · 1 fork
Harness claude cursor codex opencode gemini
a2a agent-to-agent frameworks
a2a-demo A2A Demo implementation
22.5 1 star
Harness claude cursor codex opencode gemini
a2a agent-to-agent tutorials-learning-resources
a2a-zh Chinese documentation for A2A protocol
22.5 1 star
Harness claude cursor codex opencode gemini
a2a agent-to-agent documentation
agentbench Use to put a number on harness quality: run an agent harness against a task set and get a score, so harness changes are validated by evidence. It is the eval backbone of a self-improving loop.
Unranked No signals yet
Harness claude codex
eval benchmark scoring harness
a2a-example Example implementation of A2A protocol
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tutorials-learning-resources
ai-batch-learning-resources Learning resources for AI certification
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tutorials-learning-resources
a2a-mcp-express-js This repository implements a Node.js AI agent using Express, LangChain, the Model Context Protocol (MCP), and the Agent-to-Agent (A2A) protocol
Unranked No signals yet
Harness claude cursor codex opencode gemini
a2a agent-to-agent tutorials-learning-resources
Previous Page 4 of 32 Next
Browse · Armory