Armory
Source
Browse
Skills

speculative-decoding

Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing latency for real-time applications, or deploying models with limited compute. Covers draft models, tree-based attention, Jacobi iteration, parallel token generation, and production deployment strategies.

Score
Unranked
Evidence
No signals yet
Last commit
Not known
Listed

Install

armory install speculative-decoding --cli claude

writes the skill into.claude/skills/speculative-decoding/SKILL.mdListed as compatible

Configuration
# fetches the source and writes it to:
.claude/skills/speculative-decoding/SKILL.md

Needs the armory CLI · not on npm yet, build it from cli/ in the repository

What it is

Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing latency for real-time applications, or deploying models with limited compute. Covers draft models, tree-based attention, Jacobi iteration, parallel token generation, and production deployment strategies.

When to use it

Accelerate LLM inference using speculative decoding, Medusa multiple heads, and lookahead decoding techniques. Use when optimizing inference speed (1.5-3.6× speedup), reducing latency for real-time applications, or deploying models with limited compute. Covers draft models, tree-based attention, Jacobi iteration, parallel token generation, and production deployment strategies.

How to install / invoke

# Copy the skill into your .claude/skills/ directory
curl -sL https://raw.githubusercontent.com/davila7/claude-code-templates/main/cli-tool/components/skills/ai-research/emerging-techniques-speculative-decoding/SKILL.md -o .claude/skills/emerging-techniques-speculative-decoding/SKILL.md

Notes

Extracted from davila7/claude-code-templates, emerging-techniques-speculative-decoding category.