시작하기
텍스트 음성 변환 (TTS)

텍스트 음성 변환 (TTS)

텍스트를 음성으로 변환하여 재생합니다. 변환 서비스의 타입(On Device, Google Cloud, OpenAI, ElevenLabs)은 설정 > 텍스트 음성 변환 에서 등록할 때 정하며(6부), 타입에 따라 음성을 지정하는 항목이 달라집니다. 온라인 서비스의 API 키와 ElevenLabs 의 Voice ID 를 얻는 방법은 부록 B를 참고합니다.

텍스트 음성 변환

사용할 텍스트 음성 변환을 선택합니다.

명령

  • 재생(기본값): 텍스트를 음성으로 변환하여 재생합니다.
  • 정지: 재생 중인 음성을 정지합니다.

항목

음성 ID

타입이 On Device이면 모델의 음성 ID(Speaker ID)를 숫자로 입력합니다. ID 는 모델마다 정의되며 0부터 시작하고, 유효하지 않은 값을 입력하면 첫 번째 음성이 선택됩니다. 모델별 음성 ID 는 sherpa-onnx 모델 목록에서 확인합니다. 타입이 ElevenLabs이면 사용할 음성의 Voice ID 를 입력하며, 명령이 재생일 때만 표시됩니다.

음성 이름

타입이 Google Cloud이면 음성 이름을 입력합니다. 기본값은 en-US-Standard-C 이며, 음성 목록은 Google Cloud 문서에서 확인합니다. 타입이 OpenAI이면 alloy(기본값), echo, fable, onyx, nova, shimmer 중에서 선택하며, 음성의 특징은 OpenAI 문서에서 확인합니다. 두 경우 모두 명령이 재생일 때만 표시됩니다.

출력 텍스트

음성으로 변환할 텍스트를 입력합니다. 명령이 재생일 때만 표시됩니다.

재생 종료 대기

음성 재생이 끝날 때까지 동작을 진행 중 상태로 둘지 선택합니다. 기본값은 켜짐입니다. 명령이 재생일 때만 표시됩니다.

재생 속도

0.25x, 0.5x, 0.75x, 1.0x(기본값), 1.25x, 1.5x, 2.0x, 3.0x, 4.0x 중에서 선택하거나 직접 입력을 선택하고 속도 입력 (배속)에 0.1~10 배속을 입력합니다. 명령이 재생일 때 표시되며, 타입이 ElevenLabs이면 표시되지 않습니다.