Text-агенты доминируют в tutorial'ах, но voice AI — fastest-growing юзкейс 2026: call centers, запись к врачу, status line. У вас есть Telegram-бот клиники — voice дополняет канал для пользователей 40+ и hands-free сценариев.
Stack overview
[Phone PSTN] ◄──SIP──► [Twilio / Voximplant]
│
▼
[Media Stream WebSocket]
│
▼
[OpenAI Realtime API / Deepgram+LLM+TTS]
│
┌─────────────┼─────────────┐
▼ ▼ ▼
[CRM book] [Calendar] [Escalate human]
OpenAI Realtime API (speech-to-speech)
Один WebSocket — audio in, audio out, tool calls mid-conversation:
# Conceptual: session.update with tools
tools = [{
"type": "function",
"name": "book_appointment",
"parameters": {
"type": "object",
"properties": {
"datetime": {"type": "string"},
"doctor_id": {"type": "string"},
},
},
}]
Плюсы: low latency (~300–800 ms turn), natural barge-in.
Минусы: cost, меньше control над ASR отдельно.
Alternative: cascade STT → LLM → TTS
| Layer | Options |
|---|---|
| STT | Deepgram, Whisper API, Yandex SpeechKit |
| LLM | GPT-4o-mini with tools |
| TTS | ElevenLabs, OpenAI tts-1, Yandex |
Больше latency (1,5–3 сек), но гибче (swap STT для русского).
Юзкейс: inbound запись клиники
Flow:
1. «Здравствуйте, клиника X. Чем помочь?»
2. Intent: запись / отмена / справка
3. Slot filling: специалист, дата, время
4. book_appointment → МИС API
5. SMS/Telegram confirm
6. Escalate если срочно или не понял 2 раза
KPI:
- Containment rate (без оператора): 55–70%
- Average call duration: 2:30 vs 4:10 human
- Cost per booked slot: −40%
Юзкейс: outbound напоминания
Trigger из CRM (event-driven):
- За 24h до приёма — voice reminder
- Если no answer → Telegram fallback
Compliance: согласие на robocall, opt-out, запись разговора по 152-ФЗ.
Latency budget
| Segment | Target |
|---|---|
| STT partial | < 300 ms |
| LLM first token | < 400 ms |
| TTS start | < 200 ms |
| Total turn | < 1,2 s |
Выше 2 s — пользователи перебивают, растут failures.
Tools для voice agent
Те же что text, но кор короткие ответы TTS:
- get_free_slots(doctor, date)
- create_booking(...)
- transfer_to_operator(reason)
MCP для CRM tools — переиспользование с chat agent.
n8n в voice pipeline
n8n не real-time audio, но:
- Post-call webhook → CRM update, analytics
- Failed call → retry schedule
- Human escalation → create ticket
AI loop — отдельный Python/Node service на WebSocket.
Security & recording
- PII minimization в logs
- Encrypted storage recordings
- Prompt injection via voice («ignore instructions») — защита
- Rate limit per caller ID
Cost estimate (500 calls/day, 3 min avg)
| Item | $/mo |
|---|---|
| Twilio minutes | ~$450 |
| Realtime API | ~$600–900 |
| Total | ~$1–1,4k |
ROI vs 2 FTE operators — often positive at > 400 calls/day.
vs Text Telegram bot
| Telegram bot | Voice agent | |
|---|---|---|
| Audience | digital-native | broader age |
| Cost | lower | higher |
| Latency tolerance | higher | lower |
| Complexity | lower | higher |
Оптимально — omnichannel: один backend tools, два frontends.
Вывод
Voice AI agent — трендовый юзкейс автоматизации задач с жёстким SLA latency. Realtime API упрощает stack; cascade — для русского и кастомного TTS. Начните с одного inbound flow + escalation.
Смотрите также:
- OpenAI Agents SDK
- ИИ-агент недвижимости AmoCRM