Speko, une startup YC S26, lance un OpenRouter pour simplifier le choix des modèles de voix IA

Dans l’univers en constante évolution des agents vocaux, les entreprises font face à un défi majeur : comment sélectionner et maintenir à jour la combinaison optimale de modèles de reconnaissance vocale, de langage naturel et de synthèse vocale ? Speko, une startup récemment sortie du programme Y Combinator (S26), propose une solution innovante avec son OpenRouter pour la voix IA.

Un problème persistant dans l’industrie

Les agents vocaux en production sont généralement constitués de trois couches : la reconnaissance automatique de la parole (STT), un modèle de langage (LLM) et la synthèse vocale (TTS). Avec une dozenne de fournisseurs crédibles pour chaque couche et l’émergence mensuelle de nouveaux modèles, le processus de sélection devient rapidement un casse-tête. La plupart des entreprises évaluent une fois, choisissent leur stack et n’effectuent plus jamais de réévaluation. Résultat : elles utilisent des modèles obsolètes alors que des options meilleures et moins chères sont disponibles.

L’expérience fondatrice de Speko

Avant de fonder Speko, Bek, le fondateur, a passé quatre ans en tant que cofondateur et CTO à construire des agents vocaux pour des entreprises asiatiques dans plus de 10 langues. Chaque fois qu’un nouveau modèle de parole apparaissait, son équipe devait répéter le même processus fastidieux : embaucher des évaluateurs locaux, benchmarker le modèle contre leur stack existante et mettre à jour la production si des améliorations étaient constatées. Speko automatise ce processus complexe en le transformant en une simple API.

Comment ça marche ?

L’OpenRouter de Speko fonctionne en suivant ces étapes :

  1. Vous envoyez une requête avec vos critères d’optimisation (précision, latence, coût ou équilibré), la langue et la région.

  2. Le routeur filtre les modèles mesurés pour cette combinaison de contraintes spécifiques.

  3. Il benchmarke ces modèles, sélectionne le gagnant et renvoie une réponse avec les en-têtes contenant le fournisseur, les noms des modèles et les scores.

  4. La passerelle précharge les plans de session signés, permettant à une nouvelle session d’appeler le fournisseur directement depuis la mémoire, sans aller-retour de contrôle pendant que l’appelant attend.

  5. En cas d’échec, le basculement se fait uniquement pendant la phase de configuration de la connexion.

Des résultats concrets pour les clients

Speko a déjà aidé plusieurs entreprises à optimiser leurs agents vocaux. Par exemple, un fondateur ne savait pas quel modèle choisir pour son cas d’utilisation et a maintenant tout routé à travers la plateforme. Une entreprise de gestion immobilière utilisant LiveKit en Python n’avait pas mis à jour ses modèles STT ou TTS depuis son lancement, ignorant les taux d’erreur élevés sur leurs appels. Une équipe ne savait pas quels modèles choisir pour l’espagnol, et une équipe médicale cherchait le meilleur STT pour la terminologie médicale. Dans chaque cas, Speko a aidé à trouver la bonne stack grâce à ses benchmarks.

Transparence et impartialité

Speko publie ses benchmarks, y compris les cas où leurs sélections performaient moins bien que les alternatives. Les tests incluent des prises de parole spontanées, des mentions d’argent et de dates, ainsi que des enregistrements de dix minutes. Ils ont également entraîné un scoreur automatique pour la naturalité TTS basé sur des votes d’écoute en aveugle, qui choisit le même gagnant que les évaluateurs humains dans une proportion similaire à celle où les évaluateurs s’accordent entre eux.

Modèle économique et open source

Speko propose une passerelle open source (disponible sur GitHub sous licence MIT) pour les équipes souhaitant éviter un saut de réseau supplémentaire sur le chemin audio et ne pas partager leurs clés avec leur cloud. La passerelle et la configuration BYOK (Bring Your Own Key) seront gratuites à vie, tandis que le routeur hébergé et les clés gérées avec facturation consolidée sont payants.

Depuis son lancement fin juin, l’utilisation externe de Speko a augmenté d’environ 25 pour cent par semaine en moyenne, avec une croissance front-loaded vers les semaines de lancement.

Perspectives d’avenir

Speko invite la communauté à partager ses expériences actuelles de sélection des modèles de parole et les critères qui inspirent confiance dans les benchmarks tiers. Avec son approche innovante, Speko pourrait bien redéfinir la manière dont les entreprises abordent l’optimisation des modèles de voix IA.