498 results in CLAUDE.md / Rules, Evals 路 page 2 of 21
Harness Claude Code Cursor Codex Gemini OpenCode xiaowu0162-longmemeval Benchmarking Chat Assistants on Long-Term Interactive Memory (ICLR 2025)
Contributed by Sentinel
97.5 1,049 stars 路 81 forks 路 10 mentions
Harness claude codex cursor gemini opencode
princeton-nlp-webshop [NeurIPS 2022] 馃洅WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents
Contributed by Sentinel
97.1 589 stars 路 107 forks 路 3 mentions
Harness claude codex cursor gemini opencode
stonybrooknlp-appworld 馃實 AppWorld: A Controllable World of Apps and People for Benchmarking Function Calling and Interactive Coding Agent, ACL'24 Best Resource Paper.
Contributed by Sentinel
96.7 500 stars 路 78 forks 路 4 mentions
Harness claude codex cursor gemini opencode
continuous-eval Relari's modular evaluation library for LLM pipelines with deterministic + LLM-based metrics for RAG and agent workflows.
96.2 517 stars 路 38 forks
Harness claude cursor codex opencode gemini
evals rag agents metrics
metr-task-standard METR's Task Standard: a specification and scaffold for creating agentic tasks used in autonomous agent capability evaluations.
94.3 192 stars 路 37 forks
Harness claude cursor codex opencode gemini
evals agents task-standard safety
harbor-framework-terminal-bench-2-1 Terminal-Bench 2.1
Contributed by Sentinel
94.3 119 stars 路 62 forks 路 3 mentions
Harness claude codex cursor gemini opencode
evals
vellum-evals Vellum evaluation SDK for running LLM test suites with custom metrics, dataset pinning, and CI workflow integration.
90.5 82 stars 路 20 forks
Harness claude cursor codex opencode gemini
evals sdk ci dataset
braintrust Developer platform for logging, evaluating, and comparing LLM experiments with dataset versioning and scoring functions.
82.3 27 stars 路 12 forks
Harness claude cursor codex opencode gemini
evals experiment-tracking sdk
galileo-evaluate Galileo evaluation and observability SDK for detecting hallucinations, data errors, and model weaknesses in LLM pipelines.
80.3 22 stars 路 11 forks
Harness claude cursor codex opencode gemini
evals hallucination observability sdk
humanloop-evals Humanloop Python SDK with integrated evals, dataset versioning, and human + LLM judge scoring for production pipelines.
69.0 12 stars 路 3 forks
Harness claude cursor codex opencode gemini
evals human-eval dataset sdk
pre-commit-hooks A repository of pre-commit hooks whose CLAUDE.md and .claude/ documentation is a thorough, compact example of project instructions for Claude Code.
57.3 5 stars 路 3 forks
Harness claude
claude-code claude-md-files
angular-coding-style angular rule: apply when working on angular and you need Angular Coding Style.
16.3 1 mention
Harness claude codex cursor gemini opencode
rules angular
agentbench Use to put a number on harness quality: run an agent harness against a task set and get a score, so harness changes are validated by evidence. It is the eval backbone of a self-improving loop.
Unranked No signals yet
Harness claude codex
eval benchmark scoring harness
additional-directories Grant access to additional directories outside the current project. Useful for monorepo setups, shared libraries, or when working with documentation stored in separate repositories.
Unranked No signals yet
Harness claude
permissions claudemd-rules
ai-agent-specialist Cursor rules for TypeScript, React, Node.js, clean architecture, testing, and WHY-oriented engineering guidance.
Unranked No signals yet
Harness claude cursor
cursor-rules claude-md-files rules
ai-intellij-plugin Provides comprehensive Gradle commands for IntelliJ plugin development with platform-specific coding patterns, detailed package structure guidelines, and clear internationalization standards.
Unranked No signals yet
Harness claude
claude-md rules language-specific
allow-git-operations Allow common git operations for version control workflow. Permits git status, diff, add, commit, and push operations while maintaining security by requiring explicit permission for potentially destructive operations.
Unranked No signals yet
Harness claude
permissions claudemd-rules
allow-npm-commands Allow common npm development commands (lint, test, build, start).
Unranked No signals yet
Harness claude
permissions claudemd-rules
alpha-skills-quant-factor-research Quantitative factor research skills for Cursor. Evaluate factors, run backtests, mine new alpha through natural language.
Unranked No signals yet
Harness claude cursor
cursor-rules claude-md-files rules
android-jetpack-compose-cursorrules-prompt-file Cursor rules for Android development with Jetpack Compose integration.
Unranked No signals yet
Harness claude cursor
cursor-rules claude-md-files rules
angular-hooks angular rule: apply when working on angular and you need Angular Hooks.
Unranked No signals yet
Harness claude codex cursor gemini opencode
rules angular
angular-novo-elements-cursorrules-prompt-file Cursor rules for Angular development with Novo Elements UI library.
Unranked No signals yet
Harness claude cursor
cursor-rules claude-md-files rules
angular-patterns angular rule: apply when working on angular and you need Angular Patterns.
Unranked No signals yet
Harness claude codex cursor gemini opencode
rules angular
angular-security angular rule: apply when working on angular and you need Angular Security.
Unranked No signals yet
Harness claude codex cursor gemini opencode
rules angular
Previous Page 2 of 21 Next
Browse 路 Armory