개발 문서
음성 인식
오디오를 텍스트로 옮깁니다. 한국어 회의록과 상담 녹취에 가장 많이 씁니다.
호출
POST /audio/transcriptions에 파일을 multipart로 올립니다. language를 지정하면 정확도가 올라갑니다.
| Field | Type | Note |
|---|---|---|
| file | binary | multipart, max 25MB |
| language | string | ISO code |
| timestamp_granularities | array | word | segment |
| diarize | boolean | Split by speaker |
타임스탬프
timestamp_granularities로 단어나 문장 단위 시각을 받습니다. 자막 파일을 만들 때 씁니다.
화자 분리
diarize를 켜면 화자별로 구간을 나눠 줍니다. 지원 모델만 후보에 오릅니다.