Claude
Skills
Sign in
Back

ai-voice-design

Included with Lifetime
$97 forever

Concevez et générez des voix IA pour vos vidéos en utilisant ElevenLabs ou Qwen3-TTS, avec clonage vocal, design par description, et synchronisation lip-sync. Use when: **Créer une voix de marque** - Définir le ton vocal pour une campagne; **Cloner une voix existante** - Reproduire une voix avec autorisation; **Designer une voix originale** - Créer une voix à partir d'une description; **Multi-personnages** - Gérer plusieurs voix dans une même vidéo; **Lip-sync vidéo IA** - Synchroniser voix e...

Design

What this skill does


# AI Voice Design

> Concevez et générez des voix IA pour vos vidéos en utilisant ElevenLabs ou Qwen3-TTS, avec clonage vocal, design par description, et synchronisation lip-sync.

## When to Use This Skill

- **Créer une voix de marque** - Définir le ton vocal pour une campagne
- **Cloner une voix existante** - Reproduire une voix avec autorisation
- **Designer une voix originale** - Créer une voix à partir d'une description
- **Multi-personnages** - Gérer plusieurs voix dans une même vidéo
- **Lip-sync vidéo IA** - Synchroniser voix et mouvements de lèvres
- **Localisation** - Adapter une voix en plusieurs langues

## Methodology Foundation

**Source**: ElevenLabs Documentation + Qwen3-TTS (Alibaba) + PJ Ace workflow

**Core Principle**: "La voix est 50% de l'impact d'une vidéo. ElevenLabs offre la qualité premium, Qwen3-TTS offre la flexibilité open-source. Le choix dépend du budget et du contrôle souhaité."

**Why This Matters**: Une voix mal choisie ou mal générée casse l'illusion d'une vidéo IA. Le bon matching voix/personnage et une qualité audio professionnelle font la différence entre "AI slop" et contenu crédible.


## What Claude Does vs What You Decide

| Claude Does | You Decide |
|-------------|------------|
| Structures production workflow | Final creative direction |
| Suggests technical approaches | Equipment and tool choices |
| Creates templates and checklists | Quality standards |
| Identifies best practices | Brand/voice decisions |
| Generates script outlines | Final script approval |

## What This Skill Does

1. **Compare les solutions TTS** - ElevenLabs vs Qwen3-TTS
2. **Guide le clonage vocal** - Process et requirements
3. **Structure le voice design** - Description textuelle de voix
4. **Gère le multi-voix** - Attribution et cohérence
5. **Prépare le lip-sync** - Intégration avec Kling/Veo

## How to Use

### Designer une voix pour une pub
```
J'ai besoin d'une voix pour ma pub [produit]. Le ton doit être [description]. Aide-moi à la designer.
```

### Cloner une voix
```
Je veux cloner cette voix [description/échantillon]. Guide-moi à travers le process avec [ElevenLabs/Qwen3-TTS].
```

### Gérer plusieurs personnages
```
J'ai 3 personnages dans ma vidéo: [descriptions]. Crée le casting vocal.
```

## Instructions

### Step 1: Choisir la solution TTS

```
## Comparatif ElevenLabs vs Qwen3-TTS

| Critère | ElevenLabs | Qwen3-TTS |
|---------|------------|-----------|
| **Prix** | $5-$330/mois | Gratuit (open-source) |
| **Qualité** | Excellente | Excellente |
| **Voice cloning** | 1-5 min audio | 3 sec audio |
| **Langues** | 29+ | 10 (EN, FR, DE, ES, IT, PT, RU, ZH, JP, KO) |
| **Latence** | ~200ms | 97ms (streaming) |
| **Self-hosted** | Non | Oui |
| **Voice design** | VoiceLab | Description textuelle |
| **API** | Cloud | Local ou cloud |

### Arbre de décision

**Q1: Budget disponible?**
- $0 (gratuit) → Qwen3-TTS
- $5-$100/mois → ElevenLabs Starter/Creator
- $100+/mois → ElevenLabs Pro

**Q2: Besoin de self-hosting?**
- Oui (données sensibles) → Qwen3-TTS
- Non → ElevenLabs ou Qwen3-TTS

**Q3: Langue requise parmi FR, EN, DE, ES, IT, PT, RU, ZH, JP, KO?**
- Oui → Les deux fonctionnent
- Non (autre langue) → ElevenLabs

**Q4: Latence critique (real-time)?**
- Oui → Qwen3-TTS (97ms)
- Non → Les deux
```

---

### Step 2: Voice Design par description

```
## Template de Description de Voix

### Caractéristiques de base
**Genre:** [ ] Masculin [ ] Féminin [ ] Non-binaire
**Âge apparent:** [20s / 30s / 40s / 50s / 60s+]
**Registre:** [ ] Grave [ ] Medium [ ] Aigu

### Qualités vocales
**Texture:**
[ ] Lisse/Veloutée [ ] Rauque/Gravelly
[ ] Nasale [ ] Claire [ ] Résonante

**Énergie:**
[ ] Calme/Posée [ ] Dynamique [ ] Intense
[ ] Chaleureuse [ ] Froide/Distante

**Rythme:**
[ ] Lent/Délibéré [ ] Modéré [ ] Rapide
[ ] Varié (storytelling)

### Accent/Origine
**Accent:** [Ex: Français neutre, British RP, Southern US, etc.]
**Particularités:** [Ex: légèrement rauque le matin, sourire dans la voix]

### Contexte d'utilisation
**Marque/Produit:** ________________________________
**Ton de la campagne:** ________________________________
**Personnage (si fiction):** ________________________________

### Exemples de référence (optionnel)
**Voix similaire à:** [Célébrité, personnage, pub connue]
**Éviter:** [Ce qu'on ne veut pas]
```

**Exemple de description complète:**

```
## Voice Brief: Pub NeuroBoost

**Profil:**
Homme, 40s, registre grave-medium

**Qualités:**
- Texture résonante et autoritaire mais pas intimidante
- Énergie posée, confiante, légèrement inspirante
- Rythme délibéré avec pauses stratégiques

**Accent:**
Français international (pas d'accent régional marqué)
Diction parfaite, articulation claire

**Références:**
- Similaire à: Morgan Freeman mais version française
- Éviter: Ton commercial agressif, urgence artificielle

**Notes:**
Cette voix doit incarner l'expertise et la confiance.
Le spectateur doit sentir qu'il reçoit un conseil d'un
mentor plutôt qu'un pitch de vendeur.
```

---

### Step 3: Clonage vocal

#### ElevenLabs

```
## Process de clonage ElevenLabs

### Instant Clone (1-5 min audio)
**Qualité:** Bonne (80% fidélité)
**Usage:** Tests, itération rapide

1. Préparer audio source:
   - 1-5 minutes de parole claire
   - Pas de musique de fond
   - Qualité minimum: 128kbps
   - Formats: MP3, WAV, M4A

2. Dans ElevenLabs:
   - Voice Lab → Add Voice → Instant Clone
   - Upload audio
   - Nommer la voix
   - Tester avec phrase sample

### Professional Clone (30+ min audio)
**Qualité:** Excellente (95%+ fidélité)
**Usage:** Production commerciale

1. Préparer corpus audio:
   - 30-60 minutes idéalement
   - Variété d'émotions et tons
   - Phrases complètes, pas de mots isolés
   - Studio quality (256kbps+, pas de bruit)

2. Soumettre pour training
   - Délai: 24-48h
   - Coût: Inclus dans plan Pro+

### Paramètres de génération
- **Stability:** 50-70% (naturel) / 80%+ (consistant)
- **Clarity:** 75%+ recommandé
- **Style:** 0-100% selon expressivité souhaitée
```

#### Qwen3-TTS

```
## Process de clonage Qwen3-TTS

### Zero-shot Clone (3 sec audio)
**Qualité:** Très bonne
**Usage:** Toute production

1. Préparer référence:
   - 3-10 secondes de parole claire
   - Pas de bruit de fond
   - Émotion neutre ou représentative

2. API Python:
```python
from qwen3_tts import Qwen3TTS

tts = Qwen3TTS()

# Cloner depuis référence
voice = tts.clone_voice(
    reference_audio="reference.wav",
    voice_name="my_voice"
)

# Générer avec la voix clonée
audio = tts.generate(
    text="Texte à synthétiser",
    voice=voice,
    language="fr"
)
audio.save("output.wav")
```

### Voice Design par texte
```python
# Créer une voix sans référence audio
voice = tts.design_voice(
    description="A warm, confident male voice in his 40s, \
    with a slight French accent, speaking slowly and \
    deliberately with gravitas."
)

audio = tts.generate(
    text="Votre texte ici",
    voice=voice
)
```

### Paramètres avancés
- **emotion:** "neutral", "happy", "sad", "angry", "surprise"
- **speed:** 0.5 (lent) à 2.0 (rapide)
- **pitch:** -10 à +10 (demi-tons)
```

---

### Step 4: Multi-personnages

```
## Casting Vocal Multi-personnages

### Template de casting

| Personnage | Description | Voix | Source |
|------------|-------------|------|--------|
| [Nom] | [Description physique/personnalité] | [Specs vocales] | [Clone/Design/Stock] |

### Exemple: Pub avec 3 personnages

| Personnage | Description | Voix | Source |
|------------|-------------|------|--------|
| CEO Emma | 35 ans, confiante, leader | Femme, medium, autoritaire-warm | Design: "Confident female executive..." |
| Dev Tom | 28 ans, geek enthousiaste | Homme, medium-aigu, rapide | Stock: "Young professional male" |
| Client Marc | 50 ans, sceptique puis convaincu | Homme, grave, hésitant→assuré | Design: "Skeptical older businessman..." |

### Règles de différenciation
- **Registres variés:** Grave, Medium, Aigu
- **Rythmes différents:** Lent vs Rapide
- **Accents

Related in Design