ai-voice-design
Concevez et générez des voix IA pour vos vidéos en utilisant ElevenLabs ou Qwen3-TTS, avec clonage vocal, design par description, et synchronisation lip-sync. Use when: **Créer une voix de marque** - Définir le ton vocal pour une campagne; **Cloner une voix existante** - Reproduire une voix avec autorisation; **Designer une voix originale** - Créer une voix à partir d'une description; **Multi-personnages** - Gérer plusieurs voix dans une même vidéo; **Lip-sync vidéo IA** - Synchroniser voix e...
What this skill does
# AI Voice Design
> Concevez et générez des voix IA pour vos vidéos en utilisant ElevenLabs ou Qwen3-TTS, avec clonage vocal, design par description, et synchronisation lip-sync.
## When to Use This Skill
- **Créer une voix de marque** - Définir le ton vocal pour une campagne
- **Cloner une voix existante** - Reproduire une voix avec autorisation
- **Designer une voix originale** - Créer une voix à partir d'une description
- **Multi-personnages** - Gérer plusieurs voix dans une même vidéo
- **Lip-sync vidéo IA** - Synchroniser voix et mouvements de lèvres
- **Localisation** - Adapter une voix en plusieurs langues
## Methodology Foundation
**Source**: ElevenLabs Documentation + Qwen3-TTS (Alibaba) + PJ Ace workflow
**Core Principle**: "La voix est 50% de l'impact d'une vidéo. ElevenLabs offre la qualité premium, Qwen3-TTS offre la flexibilité open-source. Le choix dépend du budget et du contrôle souhaité."
**Why This Matters**: Une voix mal choisie ou mal générée casse l'illusion d'une vidéo IA. Le bon matching voix/personnage et une qualité audio professionnelle font la différence entre "AI slop" et contenu crédible.
## What Claude Does vs What You Decide
| Claude Does | You Decide |
|-------------|------------|
| Structures production workflow | Final creative direction |
| Suggests technical approaches | Equipment and tool choices |
| Creates templates and checklists | Quality standards |
| Identifies best practices | Brand/voice decisions |
| Generates script outlines | Final script approval |
## What This Skill Does
1. **Compare les solutions TTS** - ElevenLabs vs Qwen3-TTS
2. **Guide le clonage vocal** - Process et requirements
3. **Structure le voice design** - Description textuelle de voix
4. **Gère le multi-voix** - Attribution et cohérence
5. **Prépare le lip-sync** - Intégration avec Kling/Veo
## How to Use
### Designer une voix pour une pub
```
J'ai besoin d'une voix pour ma pub [produit]. Le ton doit être [description]. Aide-moi à la designer.
```
### Cloner une voix
```
Je veux cloner cette voix [description/échantillon]. Guide-moi à travers le process avec [ElevenLabs/Qwen3-TTS].
```
### Gérer plusieurs personnages
```
J'ai 3 personnages dans ma vidéo: [descriptions]. Crée le casting vocal.
```
## Instructions
### Step 1: Choisir la solution TTS
```
## Comparatif ElevenLabs vs Qwen3-TTS
| Critère | ElevenLabs | Qwen3-TTS |
|---------|------------|-----------|
| **Prix** | $5-$330/mois | Gratuit (open-source) |
| **Qualité** | Excellente | Excellente |
| **Voice cloning** | 1-5 min audio | 3 sec audio |
| **Langues** | 29+ | 10 (EN, FR, DE, ES, IT, PT, RU, ZH, JP, KO) |
| **Latence** | ~200ms | 97ms (streaming) |
| **Self-hosted** | Non | Oui |
| **Voice design** | VoiceLab | Description textuelle |
| **API** | Cloud | Local ou cloud |
### Arbre de décision
**Q1: Budget disponible?**
- $0 (gratuit) → Qwen3-TTS
- $5-$100/mois → ElevenLabs Starter/Creator
- $100+/mois → ElevenLabs Pro
**Q2: Besoin de self-hosting?**
- Oui (données sensibles) → Qwen3-TTS
- Non → ElevenLabs ou Qwen3-TTS
**Q3: Langue requise parmi FR, EN, DE, ES, IT, PT, RU, ZH, JP, KO?**
- Oui → Les deux fonctionnent
- Non (autre langue) → ElevenLabs
**Q4: Latence critique (real-time)?**
- Oui → Qwen3-TTS (97ms)
- Non → Les deux
```
---
### Step 2: Voice Design par description
```
## Template de Description de Voix
### Caractéristiques de base
**Genre:** [ ] Masculin [ ] Féminin [ ] Non-binaire
**Âge apparent:** [20s / 30s / 40s / 50s / 60s+]
**Registre:** [ ] Grave [ ] Medium [ ] Aigu
### Qualités vocales
**Texture:**
[ ] Lisse/Veloutée [ ] Rauque/Gravelly
[ ] Nasale [ ] Claire [ ] Résonante
**Énergie:**
[ ] Calme/Posée [ ] Dynamique [ ] Intense
[ ] Chaleureuse [ ] Froide/Distante
**Rythme:**
[ ] Lent/Délibéré [ ] Modéré [ ] Rapide
[ ] Varié (storytelling)
### Accent/Origine
**Accent:** [Ex: Français neutre, British RP, Southern US, etc.]
**Particularités:** [Ex: légèrement rauque le matin, sourire dans la voix]
### Contexte d'utilisation
**Marque/Produit:** ________________________________
**Ton de la campagne:** ________________________________
**Personnage (si fiction):** ________________________________
### Exemples de référence (optionnel)
**Voix similaire à:** [Célébrité, personnage, pub connue]
**Éviter:** [Ce qu'on ne veut pas]
```
**Exemple de description complète:**
```
## Voice Brief: Pub NeuroBoost
**Profil:**
Homme, 40s, registre grave-medium
**Qualités:**
- Texture résonante et autoritaire mais pas intimidante
- Énergie posée, confiante, légèrement inspirante
- Rythme délibéré avec pauses stratégiques
**Accent:**
Français international (pas d'accent régional marqué)
Diction parfaite, articulation claire
**Références:**
- Similaire à: Morgan Freeman mais version française
- Éviter: Ton commercial agressif, urgence artificielle
**Notes:**
Cette voix doit incarner l'expertise et la confiance.
Le spectateur doit sentir qu'il reçoit un conseil d'un
mentor plutôt qu'un pitch de vendeur.
```
---
### Step 3: Clonage vocal
#### ElevenLabs
```
## Process de clonage ElevenLabs
### Instant Clone (1-5 min audio)
**Qualité:** Bonne (80% fidélité)
**Usage:** Tests, itération rapide
1. Préparer audio source:
- 1-5 minutes de parole claire
- Pas de musique de fond
- Qualité minimum: 128kbps
- Formats: MP3, WAV, M4A
2. Dans ElevenLabs:
- Voice Lab → Add Voice → Instant Clone
- Upload audio
- Nommer la voix
- Tester avec phrase sample
### Professional Clone (30+ min audio)
**Qualité:** Excellente (95%+ fidélité)
**Usage:** Production commerciale
1. Préparer corpus audio:
- 30-60 minutes idéalement
- Variété d'émotions et tons
- Phrases complètes, pas de mots isolés
- Studio quality (256kbps+, pas de bruit)
2. Soumettre pour training
- Délai: 24-48h
- Coût: Inclus dans plan Pro+
### Paramètres de génération
- **Stability:** 50-70% (naturel) / 80%+ (consistant)
- **Clarity:** 75%+ recommandé
- **Style:** 0-100% selon expressivité souhaitée
```
#### Qwen3-TTS
```
## Process de clonage Qwen3-TTS
### Zero-shot Clone (3 sec audio)
**Qualité:** Très bonne
**Usage:** Toute production
1. Préparer référence:
- 3-10 secondes de parole claire
- Pas de bruit de fond
- Émotion neutre ou représentative
2. API Python:
```python
from qwen3_tts import Qwen3TTS
tts = Qwen3TTS()
# Cloner depuis référence
voice = tts.clone_voice(
reference_audio="reference.wav",
voice_name="my_voice"
)
# Générer avec la voix clonée
audio = tts.generate(
text="Texte à synthétiser",
voice=voice,
language="fr"
)
audio.save("output.wav")
```
### Voice Design par texte
```python
# Créer une voix sans référence audio
voice = tts.design_voice(
description="A warm, confident male voice in his 40s, \
with a slight French accent, speaking slowly and \
deliberately with gravitas."
)
audio = tts.generate(
text="Votre texte ici",
voice=voice
)
```
### Paramètres avancés
- **emotion:** "neutral", "happy", "sad", "angry", "surprise"
- **speed:** 0.5 (lent) à 2.0 (rapide)
- **pitch:** -10 à +10 (demi-tons)
```
---
### Step 4: Multi-personnages
```
## Casting Vocal Multi-personnages
### Template de casting
| Personnage | Description | Voix | Source |
|------------|-------------|------|--------|
| [Nom] | [Description physique/personnalité] | [Specs vocales] | [Clone/Design/Stock] |
### Exemple: Pub avec 3 personnages
| Personnage | Description | Voix | Source |
|------------|-------------|------|--------|
| CEO Emma | 35 ans, confiante, leader | Femme, medium, autoritaire-warm | Design: "Confident female executive..." |
| Dev Tom | 28 ans, geek enthousiaste | Homme, medium-aigu, rapide | Stock: "Young professional male" |
| Client Marc | 50 ans, sceptique puis convaincu | Homme, grave, hésitant→assuré | Design: "Skeptical older businessman..." |
### Règles de différenciation
- **Registres variés:** Grave, Medium, Aigu
- **Rythmes différents:** Lent vs Rapide
- **AccentsRelated in Design
contribute
IncludedLocal-only OSS contribution command center. Auto-refreshes the user's in-flight PR and issue state on invoke so conversations start with full context — no need to brief Claude on what's in flight. Helps the user find issues to contribute to on GitHub, builds per-repo dossiers of what each upstream expects (CLA, DCO, branch convention, AI policy, draft-first, review bots, issue templates), runs deterministic gates before any external action so AI-assisted contributions don't reach maintainers as slop. State is markdown-only: candidate files at ~/.contribute-system/candidates/, repo dossiers at ~/.contribute-system/research/, append-only event log at ~/.contribute-system/log.jsonl. No database, no cloud calls. Use when the user asks about their PRs / issues / contributions, wants to find new work to take on, claim an issue, build/refresh a repo's dossier, or draft a Design Issue or PR. Trigger with "/contribute", "what's my PR status", "find a contribution", "claim issue X", "draft a Design Issue for Y", "refresh dossier for Z".
architectural-analysis
IncludedUser-triggered deep architectural analysis of a codebase or scoped subtree across eight modes — information architecture, data flow, integration points, UI surfaces, interaction patterns, data model, control flow, and failure modes. This skill should be used when the user asks to "diagram this codebase," "map the architecture," "show the data flow," "give me an ERD," "trace control flow," "find the integration points," "verify the layout pattern," "audit the UX architecture," or any similar request whose primary deliverable is mermaid diagrams plus cited reports under docs/architecture/. Dispatches haiku/sonnet sub-agents in parallel for per-mode exploration, then verifies every citation mechanically before any node lands in a diagram. Not for one-off prose explanations of code (use code-explanation) or for high-level system design from scratch (use system-design).
mcp
IncludedModel Context Protocol (MCP) server development and tool management. Languages: Python, TypeScript. Capabilities: build MCP servers, integrate external APIs, discover/execute MCP tools, manage multi-server configs, design agent-centric tools. Actions: create, build, integrate, discover, execute, configure MCP servers/tools. Keywords: MCP, Model Context Protocol, MCP server, MCP tool, stdio transport, SSE transport, tool discovery, resource provider, prompt template, external API integration, Gemini CLI MCP, Claude MCP, agent tools, tool execution, server config. Use when: building MCP servers, integrating external APIs as MCP tools, discovering available MCP tools, executing MCP capabilities, configuring multi-server setups, designing tools for AI agents.
react-native-skia
IncludedDesign, build, debug, and optimise high-polish animated graphics in React Native or Expo using @shopify/react-native-skia, Reanimated, and Gesture Handler. Use when the user wants canvas-driven UI, shaders, paths, rich text, image filters, sprite fields, Skottie, video frames, snapshots, web CanvasKit setup, or performance tuning for custom motion-heavy elements such as loaders, hero art, cards, charts, progress indicators, particle systems, or gesture-driven surfaces. Also use when the user asks for fluid, glow, glass, blob, parallax, 60fps/120fps, or GPU-friendly animated effects in React Native, even if they do not explicitly say "Skia". Do not use for ordinary form/layout work with standard views.
plaid
IncludedProduct Led AI Development — guides founders from idea to launched product. Six capabilities: Idea (discover a product idea), Validate (pressure-test the idea against fatal flaws, problem reality, competition, and 2-week MVP feasibility), Plan (vision intake + document generation), Design (translate image references into a design.md spec), Launch (go-to-market strategy), and Build (roadmap execution). Use when someone says "PLAID", "plaid idea", "help me find an idea", "product idea", "idea from my business", "idea from my expertise", "plaid validate", "validate my idea", "pressure-test", "is this idea good", "find fatal flaws", "validate the problem", "plan a product", "define my vision", "generate a PRD", "product strategy", "plaid design", "design from image", "translate image to design", "create design.md", "extract design tokens", "plaid launch", "go-to-market", "launch plan", "GTM strategy", "launch playbook", "plaid build", "build the app", "start building", or "execute the roadmap".
nextjs-framer-motion-animations
IncludedAdds production-safe Motion for React or Framer Motion animations to Next.js apps, including reveal, hover and tap micro-interactions, whileInView, stagger, AnimatePresence, layout and layoutId transitions, reorder, scroll-linked UI, and lightweight route-content transitions. Use when the user asks to add, refactor, or debug Motion or Framer Motion in App Router or Pages Router codebases, especially around server/client boundaries, reduced motion, LazyMotion, bundle size, hydration, or route transitions. Avoid for GSAP-style timelines, WebGL or 3D scenes, heavy scroll storytelling, or CSS-only effects unless Motion is explicitly requested.