model-routing-patterns
Model routing configuration templates and strategies for cost optimization, speed optimization, quality optimization, and intelligent fallback chains. Use when building AI applications with OpenRouter, implementing model routing strategies, optimizing API costs, setting up fallback chains, implementing quality-based routing, or when user mentions model routing, cost optimization, fallback strategies, model selection, intelligent routing, or dynamic model switching.
What this skill does
# Model Routing Patterns
Production-ready model routing configurations and strategies for OpenRouter that optimize for cost, speed, quality, or balanced performance with intelligent fallback chains.
## Purpose
This skill provides comprehensive templates, scripts, and strategies for implementing sophisticated model routing in OpenRouter-powered applications. It helps you:
- Reduce API costs by routing to cheaper models when appropriate
- Optimize for speed with fast models and streaming
- Maintain quality with premium model fallbacks
- Implement intelligent task-based routing
- Build reliable multi-tier fallback chains
## Activation Triggers
Use this skill when:
- Designing model routing strategies
- Implementing cost optimization
- Setting up fallback chains for reliability
- Building task complexity-based routing
- Configuring dynamic model selection
- Optimizing API performance vs cost tradeoffs
- Implementing A/B testing for models
- Setting up monitoring and analytics
## Available Routing Strategies
### 1. Cost-Optimized Routing
**Goal:** Minimize API costs while maintaining acceptable quality
**Strategy:**
- Use free models (google/gemma-2-9b-it:free, meta-llama/llama-3.2-3b-instruct:free)
- Fallback to budget models (anthropic/claude-4.5-sonnet, openai/gpt-4o-mini)
- Premium models only for complex tasks requiring highest quality
**Template:** `templates/cost-optimized-routing.json`
**Best for:**
- High-volume applications
- Simple tasks (classification, extraction, formatting)
- Development/testing environments
- Budget-constrained projects
### 2. Speed-Optimized Routing
**Goal:** Minimize latency and response time
**Strategy:**
- Prioritize fastest models regardless of cost
- Enable streaming for immediate feedback
- Use smaller models with quick inference
- Geographic routing to nearest endpoints
**Template:** `templates/speed-optimized-routing.json`
**Best for:**
- Real-time chat applications
- Interactive user experiences
- Low-latency requirements
- Streaming responses
### 3. Quality-Optimized Routing
**Goal:** Maximize output quality with premium models
**Strategy:**
- Use top-tier models (gpt-4o, claude-4.5-sonnet, gemini-pro)
- Fallback to other premium models for availability
- Multi-model voting for critical tasks
- Quality verification layers
**Template:** `templates/quality-optimized-routing.json`
**Best for:**
- Critical business decisions
- Content creation
- Complex reasoning tasks
- Customer-facing applications
### 4. Balanced Routing
**Goal:** Dynamically route based on task complexity
**Strategy:**
- Analyze request complexity
- Route simple tasks to cheap models
- Route complex tasks to premium models
- Adaptive based on success metrics
**Template:** `templates/balanced-routing.json`
**Best for:**
- Mixed workloads
- Production applications
- General-purpose AI services
- Optimizing cost/quality tradeoff
### 5. Custom Routing
**Goal:** Implement domain-specific routing logic
**Template:** `templates/custom-routing-template.json`
**Customizable factors:**
- User tier/subscription level
- Geographic location
- Time of day pricing
- Model availability
- Rate limit status
- Historical success rates
## Key Resources
### Scripts
**validate-routing-config.sh**
- Validates routing configuration syntax
- Checks model availability on OpenRouter
- Verifies fallback chain logic
- Ensures no circular dependencies
- Validates model IDs and parameters
**test-fallback-chain.sh**
- Tests fallback chain execution
- Simulates model failures
- Verifies graceful degradation
- Measures latency through chain
- Validates error handling
**generate-routing-config.sh**
- Generates routing config from strategy type
- Interactive configuration builder
- Validates and optimizes settings
- Exports to JSON/TypeScript/Python formats
**analyze-cost-savings.sh**
- Analyzes potential cost savings from routing
- Compares routing strategies
- Projects monthly costs
- Generates cost reports
- Identifies optimization opportunities
### Templates
**Configuration Templates (JSON):**
- `cost-optimized-routing.json` - Free/cheap models with premium fallback
- `speed-optimized-routing.json` - Fastest models with streaming
- `quality-optimized-routing.json` - Premium models with fallbacks
- `balanced-routing.json` - Task-based dynamic routing
- `custom-routing-template.json` - Template for custom strategies
**Code Templates:**
- `routing-config.ts` - TypeScript routing configuration
- `routing-config.py` - Python routing configuration
### Examples
- `cost-routing-example.md` - Complete cost-optimized routing setup
- `dynamic-routing-example.md` - Task complexity-based routing
- `fallback-chain-example.md` - 3-tier fallback strategy
- `monitoring-example.md` - Cost tracking and analytics setup
## Workflow
### 1. Identify Requirements
Determine your optimization goals:
```bash
# Interactive strategy selector
./scripts/generate-routing-config.sh
```
Answer questions about:
- Primary goal (cost/speed/quality/balanced)
- Budget constraints
- Latency requirements
- Quality thresholds
- Supported model providers
### 2. Generate Configuration
```bash
# Generate from strategy type
./scripts/generate-routing-config.sh cost-optimized > config.json
# Or copy template
cp templates/cost-optimized-routing.json config.json
```
### 3. Validate Configuration
```bash
# Validate syntax and model availability
./scripts/validate-routing-config.sh config.json
```
Checks:
- JSON syntax
- Model IDs exist on OpenRouter
- Fallback chain is valid
- No circular references
- Required fields present
### 4. Test Fallback Chain
```bash
# Test fallback behavior
./scripts/test-fallback-chain.sh config.json
```
Simulates failures to ensure graceful degradation.
### 5. Analyze Cost Impact
```bash
# Compare routing strategies
./scripts/analyze-cost-savings.sh config.json baseline-config.json
```
Shows projected savings and performance tradeoffs.
### 6. Deploy and Monitor
- Deploy configuration to production
- Monitor using examples/monitoring-example.md
- Track metrics: cost, latency, success rate, quality
- Iterate based on real-world performance
## Common Routing Patterns
### Pattern 1: Simple Fallback Chain
```json
{
"primary": "meta-llama/llama-3.2-3b-instruct:free",
"fallback": [
"anthropic/claude-4.5-sonnet",
"openai/gpt-4o-mini"
]
}
```
### Pattern 2: Task Complexity Routing
```json
{
"simple_tasks": {
"models": ["google/gemma-2-9b-it:free"]
},
"medium_tasks": {
"models": ["anthropic/claude-4.5-sonnet"]
},
"complex_tasks": {
"models": ["openai/gpt-4o"]
}
}
```
### Pattern 3: Time-Based Routing
```json
{
"peak_hours": {
"models": ["openai/gpt-4o-mini"],
"max_latency_ms": 1000
},
"off_peak": {
"models": ["google/gemini-pro"],
"max_latency_ms": 3000
}
}
```
### Pattern 4: User Tier Routing
```json
{
"free_tier": {
"models": ["meta-llama/llama-3.2-3b-instruct:free"],
"rate_limit": 10
},
"premium_tier": {
"models": ["anthropic/claude-4.5-sonnet"],
"rate_limit": 1000
}
}
```
## Model Categories for Routing
### Free Models (Cost: $0)
- `google/gemma-2-9b-it:free`
- `meta-llama/llama-3.2-3b-instruct:free`
- `meta-llama/llama-3.2-1b-instruct:free`
- `microsoft/phi-3-mini-128k-instruct:free`
**Use for:** High-volume, simple tasks, development
### Budget Models (Cost: $0.10-0.50/1M tokens)
- `openai/gpt-4o-mini`
- `google/gemini-flash-1.5`
**Use for:** Production workloads, balanced cost/quality
### Premium Models (Cost: $3-15/1M tokens)
- `anthropic/claude-4.5-sonnet`
- `openai/gpt-4o`
- `google/gemini-pro-1.5`
**Use for:** Complex reasoning, critical tasks, high quality
### Specialized Models
- **Vision:** `openai/gpt-4-vision-preview`
- **Code:** `anthropic/claude-4.5-sonnet` (code-specific)
- **Long Context:** `google/gemini-pro-1.5` (1M+ tokens)
## Best Practices
1. **Always implement fallback chains** - Single points of failure cause downtime
2. **MonRelated in Backend & APIs
jfrog
IncludedInteract with the JFrog Platform via the JFrog CLI and REST/GraphQL APIs. Use this skill when the user wants to manage Artifactory repositories, upload or download artifacts, manage builds, configure permissions, manage users and groups, work with access tokens, configure JFrog CLI servers, search artifacts, manage properties, set up replication, manage JFrog Projects, run security audits or scans, look up CVE details, query exposures scan results from JFrog Advanced Security, manage release bundles and lifecycle operations, aggregate or export platform data, or perform any JFrog Platform administration task. Also use when the user mentions jf, jfrog, artifactory, xray, distribution, evidence, apptrust, onemodel, graphql, workers, mission control, curation, advanced security, exposures, or any JFrog product name.
cupynumeric-migration-readiness
IncludedPre-migration readiness assessor for porting NumPy to cuPyNumeric. Use BEFORE substantial porting work begins when the user asks whether code will scale on GPU, whether they should migrate to cuPyNumeric, which NumPy patterns transfer cleanly, what must be refactored before porting, or mentions pre-port assessment, scaling analysis, or refactor planning. Inspect the user's source code, look up NumPy usage, cross-reference the cuPyNumeric API support manifest, and distinguish distributed-scaling-friendly patterns from blockers such as unsupported APIs, scalar synchronization, host round-trips, Python/object-heavy control flow, shape/data-dependent branching, and in-place mutation hazards. Produce a verdict of READY, LIGHT REFACTOR, SIGNIFICANT REFACTOR, or NOT RECOMMENDED, with concrete refactor pointers.
alibabacloud-data-agent-skill
IncludedInvoke Alibaba Cloud Apsara Data Agent for Analytics via CLI to perform natural language-driven data analysis on enterprise databases. Data Agent for Analytics is an intelligent data analysis agent developed by Alibaba Cloud Database team for enterprise users. It automatically completes requirement analysis, data understanding, analysis insights, and report generation based on natural language descriptions. This tool supports: discovering data resources (instances/databases/tables) managed in DMS, initiating query or deep analysis sessions, real-time progress tracking, and retrieving analysis conclusions and generated reports. Use this Skill when users need to query databases, analyze data trends, generate data reports, ask questions in natural language, or mention "Data Agent", "data analysis", "database query", "SQL analysis", "data insights".
token-optimizer
IncludedReduce OpenClaw token usage and API costs through smart model routing, heartbeat optimization, budget tracking, and native 2026.2.15 features (session pruning, bootstrap size limits, cache TTL alignment). Use when token costs are high, API rate limits are being hit, or hosting multiple agents at scale. The 4 executable scripts (context_optimizer, model_router, heartbeat_optimizer, token_tracker) are local-only — no network requests, no subprocess calls, no system modifications. Reference files (PROVIDERS.md, config-patches.json) document optional multi-provider strategies that require external API keys and network access if you choose to use them. See SECURITY.md for full breakdown.
resend-cli
IncludedUse this skill when the task is specifically about operating Resend from an AI agent, terminal session, or CI job via the official resend CLI: installing/authenticating the CLI, sending/listing/updating/cancelling emails, batch sends, domains and DNS, webhooks and local listeners, inbound receiving, contacts, topics, segments, broadcasts, templates, API keys, profiles, or debugging Resend CLI/API failures. Trigger on mentions of Resend CLI, `resend`, `resend doctor`, `resend emails send`, `resend domains`, `resend webhooks listen`, `resend emails receiving`, or agent-friendly terminal automation.
alibabacloud-odps-maxframe-coding
IncludedUse this skill for MaxFrame SDK development and documentation navigation on Alibaba Cloud MaxCompute (ODPS). Helps answer MaxFrame API, concept, official example, and supported pandas API questions; create data processing programs; read/write MaxCompute tables; debug jobs (remote or local); and build custom DPE runtime images. Trigger when users mention MaxFrame, MaxCompute with MaxFrame, ODPS table processing, DPE runtime, MaxFrame docs/examples, DataFrame/Tensor operations, or GPU runtime setup. Works for both English and Chinese queries about Alibaba Cloud data processing with MaxFrame.