Skip to main content

SarvamAITTS

Sarvam AI text-to-speech (TTS) synthesizer.

Constructor

apiKey
string
Sarvam AI API key. Defaults to the SARVAM_API_KEY environment variable.
model
SarvamAITTSModel | string
TTS model id. Default 'bulbul:v3'.
language
string
Language code. Default 'en-IN'.
speaker
string
Speaker/voice id. Default 'shubh'.
streaming
boolean
Stream audio as it is synthesized. Default true.
sampleRate
number
Output audio sample rate in Hz. Default 24000.
outputAudioCodec
string
Output audio codec.
pitch
number | null
Pitch adjustment. Default 0.0.
pace
number | null
Speaking pace multiplier. Default 1.0.
loudness
number | null
Loudness multiplier. Default 1.0.
temperature
number | null
Sampling temperature. Default 0.6.
bitrate
string
Output audio bitrate. Default '128k'.
minBufferSize
number
Minimum buffer size before emitting audio.
maxChunkLength
number
Maximum characters per synthesis chunk.
preprocessing
boolean
Enable text preprocessing/normalization. Default false.

close

Release any resources held by the provider.

closeEmitter

Close the emitter: drop all handlers and stop emitting. Waits up to 2 seconds for in-flight async handlers to settle before returning.

emit

event
string
required

getRuntimeConfig

returns
Record<string, any>

interrupt

Stop the current synthesis.

listenerCount

event
string
required
returns
number

off

event
string
required
handler
EventHandler
required

on

event
string
required
handler
EventHandler
required
returns
EventHandler

once

event
string
required
handler
EventHandler
required
returns
EventHandler

onFirstAudioByte

Register a callback fired when the first synthesized audio byte is emitted.
callback
FirstAudioByteCallback
required

removeAllListeners

event
string

synthesize

Synthesize and speak text on the active session.
text
any
required

SarvamAITTSModel

Supported Sarvam AI TTS model names.