Skip to main content

AzureSTT

Azure (Cognitive Services) speech-to-text provider. Creates a configured Azure Speech STT provider for use in a voice agent.

Constructor

speechKey
string
Azure Speech key. Falls back to the AZURE_SPEECH_KEY env var.
speechRegion
string
Azure Speech region. Falls back to the AZURE_REGION env var, then 'eastus'.
language
string
Recognition language code. Default: 'en-US'.
sampleRate
number
Input audio sample rate in Hz. Default: 16000.
enablePhraseList
boolean
Enable a phrase list to bias recognition.
phraseList
string[]
Phrases to bias recognition toward.

close

Release any resources held by the provider.

closeEmitter

Close the emitter: drop all handlers and stop emitting. Waits up to 2 seconds for in-flight async handlers to settle before returning.

emit

event
string
required

getRuntimeConfig

returns
Record<string, any>

listenerCount

event
string
required
returns
number

off

event
string
required
handler
EventHandler
required

on

event
string
required
handler
EventHandler
required
returns
EventHandler

once

event
string
required
handler
EventHandler
required
returns
EventHandler

onSttTranscript

Register a callback to receive transcripts as they are produced.
callback
SttTranscriptCallback
required

processAudio

Process a buffer of audio frames. Override in a custom provider.

removeAllListeners

event
string

streamTranscribe

Transcribe a streaming audio source, yielding STTResponses. Override in a custom provider.
returns
AsyncIterator<STTResponse>

AzureOpenAISTT

Azure OpenAI speech-to-text provider. Creates a configured Azure OpenAI transcription provider for use in a voice agent.

Constructor

apiKey
string | null
Azure OpenAI API key. Falls back to the AZURE_API_KEY then AZURE_OPENAI_API_KEY env vars, then null.
azureEndpoint
string | null
Azure OpenAI resource endpoint. Falls back to the AZURE_OPENAI_ENDPOINT env var, then null.
deployment
string | null
Azure deployment name. Falls back to the AZURE_OPENAI_STT_DEPLOYMENT env var, then null.
apiVersion
string
Azure OpenAI REST API version. Default: '2025-03-01-preview'.
model
AzureOpenAISTTModel | string
Transcription model name. Default: ''.
language
string
Transcription language code. Default: 'en'.
stream
boolean
Whether to use streaming transcription. Default: false.
inputSampleRate
number
Input audio sample rate in Hz. Default: 48000.
outputSampleRate
number
Output audio sample rate in Hz. Default: 24000.
prompt
string | null
Optional prompt to bias transcription. Default: null.
temperature
number | null
Sampling temperature. Default: null.
responseFormat
string
Response format, e.g. 'json', 'text'. Default: 'json'.
turnDetection
string
Turn-detection mode, e.g. 'server_vad'. Default: 'server_vad'.

close

Release any resources held by the provider.

closeEmitter

Close the emitter: drop all handlers and stop emitting. Waits up to 2 seconds for in-flight async handlers to settle before returning.

emit

event
string
required

getRuntimeConfig

returns
Record<string, any>

listenerCount

event
string
required
returns
number

off

event
string
required
handler
EventHandler
required

on

event
string
required
handler
EventHandler
required
returns
EventHandler

once

event
string
required
handler
EventHandler
required
returns
EventHandler

onSttTranscript

Register a callback to receive transcripts as they are produced.
callback
SttTranscriptCallback
required

processAudio

Process a buffer of audio frames. Override in a custom provider.

removeAllListeners

event
string

streamTranscribe

Transcribe a streaming audio source, yielding STTResponses. Override in a custom provider.
returns
AsyncIterator<STTResponse>

AzureOpenAISTTModel

Supported Azure OpenAI STT transcription model names.