Speech that understands the clinic.
Densper STT — 치과 진료 현장을 위해 학습된 실시간 음성인식
진료실 소음, 마스크 발화, 겹치는 대화 속에서도 치의학 용어를 알아듣도록 학습됐습니다.
파일 업로드와 실시간 스트리밍(WebSocket)을 모두 지원하고, 단어·세그먼트 단위 타임스탬프를 반환합니다.
이렇게 요청하고, 이렇게 받습니다
{ "language": "ko", "segments": [ ], }
고정된 예시입니다. 실제 호출 결과가 아닙니다.
핵심 기능
Streaming STT
WebSocket 실시간 전사와 파일 단위 전사를 하나의 키로. 발화 중에도 부분 결과를 즉시 반환합니다.
치과 특화 어휘
치의학 전문용어와 진료실 발화 환경으로 학습된 도메인 모델. 용어 바이어싱으로 현장 정확도를 끌어올립니다.
화자분리
의료진과 환자의 발화를 스트리밍 중에 분리합니다. 상담·진료 기록의 기본 단위를 만들어 줍니다.
언어 지원
한국어·영어·중국어·일본어·스페인어 음성인식을 제공하며, 한 대화 안에서 언어가 바뀌어도 code-switching으로 이어서 인식합니다. 치주 차팅은 언어와 별개의 전용 모델을 사용합니다.
VAD
발화 구간을 자동 감지해 침묵을 걷어내고 필요한 구간만 전사합니다.
타임스탬프
단어·세그먼트 단위 타임스탬프로 녹취 검토·자막·구간 탐색을 지원합니다.
치과 환경에서 측정한 결과
치과 진료 음성을 대상으로 한 AIzac 내부 평가입니다. 조건과 비교군을 함께 적었습니다.
| 지표 | Densper | 비교군 |
|---|---|---|
| 치과 진료 음성인식 오류율영어 치과 도메인 음성을 대상으로 측정한 전체 음성인식 오류율입니다. 값이 낮을수록 좋습니다. | 2.66 | 7.30 / 8.29 |
| 전문용어 가중치 적용 시 오류율 감소치과 전문용어 가중치 적용에 따른 오류율 감소 폭을 비교한 내부 평가입니다. 값이 높을수록 좋습니다. | 55.5% | 50.0% / 7.1% / 0.0% |
| 화자분리 처리 시간i7-13700K 8코어 CPU에서 13분 37초 오디오의 화자분리를 7.72초에 처리했습니다. 비교군은 동일 조건에서 174초 / 348초였습니다. 인식 속도가 아니라 화자분리 단계의 처리 시간입니다. | 7.72s | 174s / 348s |
세 수치는 서로 다른 지표라 합산하거나 서로 비교할 수 없으며, 모두 AIzac 내부 평가 기준입니다. 환경·오디오 조건·언어·설정에 따라 결과가 달라질 수 있고, 데이터셋·측정 프로토콜은 요청 시 제공합니다.
현장의 언어에 맞는 음성인식
언어는 요청할 때 지정합니다. 엔드포인트별 지정 방식은 개발자 문서를 참조하세요.
치주 차팅에는 수치·치식 발화에 특화된 전용 perio 모델을 쓰세요.
몇 줄이면 연동됩니다
REST 호출은 X-License-Key 헤더로, WebSocket 연결은 key 쿼리 파라미터로 인증합니다. 지금 쓰는 스택에 그대로 붙습니다.
read docs// 예시 요청. 전체 요청 스키마는 docs 참조 curl https://api.denthub.ai/stt \ -H "X-License-Key: $DENSPER_KEY" \ -F audio=@visit.wav -F language=ko # → text, words[], timestamps[]
현장에서 이렇게 씁니다
체어사이드 차팅
진료 중 발화를 실시간 전사해 차트 초안의 재료를 만듭니다. 치주 검사에는 전용 perio 모델을 사용합니다.
상담 녹취
상담실 대화를 화자분리와 함께 기록해 동의·설명 이력을 남깁니다.
실시간 자막
청각장애 환자와의 소통을 위한 진료 자막. 공공 의료 현장에서 실제로 구축 중인 시나리오입니다.
이 엔진 위에 지어진 완성형 솔루션: AI Perio Note · AI Scribe · TransEra
세 단계면 충분합니다
라이선스 키 발급
도입 문의를 통해 라이선스 키를 발급받습니다.
API 호출
REST 호출은 X-License-Key 헤더로, WebSocket 연결은 key 쿼리 파라미터로 인증합니다.
사용량 기반 과금
쓴 만큼만 월 단위로 정산됩니다. 볼륨 계약은 영업팀과 상의하세요.
자주 묻는 질문
실시간과 파일 전사의 차이는 무엇인가요?▾
실시간(WebSocket)은 발화 중 부분 결과를 즉시 반환해 자막·차팅 같은 라이브 시나리오에 맞고, 파일(File STT)은 녹음 완료 후 업로드해 전체 결과를 받는 방식입니다.
오디오 입력 형식은 무엇을 지원하나요?▾
입력 오디오 포맷과 스트리밍 규격은 개발자 문서의 Endpoints 항목을 참조하세요.
일반 STT와 무엇이 다른가요?▾
치의학 전문용어와 실제 진료실 발화 환경(소음·마스크·겹침 발화)으로 학습된 도메인 모델이며, 용어 바이어싱으로 현장 어휘를 우선 인식합니다.
한국어 외 언어도 되나요?▾
한국어·영어·중국어·일본어·스페인어를 지원하며, 한 대화 안에서 언어가 바뀌는 경우에도 code-switching을 지원합니다.
치주 차팅은 언어와 별개의 전용 모델을 사용합니다. 엔드포인트별 언어 지정 방식과 파라미터 값은 개발자 문서를 참조하세요.