소리 분류
오디오 분석기의 타입입니다. 마이크 입력(또는 스피커 출력)의 소리를 Google YAMNet 모델이 학습한 AudioSet 의 521가지 범주(사람 목소리, 음악, 개 짖는 소리, 알람, 유리 깨지는 소리, 비명, 자동차 경적 등) 중에서 분류합니다. 이상 소리 감지, 환경음 분석에 활용합니다. 소리의 입력원은 분석기 설정의 오디오 소스에서 마이크 (입력) 또는 스피커 (출력)로 고릅니다.
알아두기
오디오 분석은 분석 추가 뒤에 분석 시작 명령을 실행해야
결과가 기록됩니다.
명령
| 명령 | 설명 |
|---|---|
| 특정 소리 여부 | 지정한 소리가 임계값 이상의 확률로 감지되었는지 확인합니다. |
| 인식 결과 | 가장 높은 확률의 소리 이름과 확률을 기록합니다. |
| 전체 결과 | 모든 인식 결과를 확률 순으로 JSON 에 기록합니다. |
설정
| 항목 | 설명 |
|---|---|
| 감지 소리 | 특정 소리 여부에서 감시할 소리입니다. 521가지 범주(영문 이름) 중에서 선택하며 기본값은 Speech입니다. |
| 감지 임계값 (%) | 이 값 이상의 확률일 때 해당 소리로 판정합니다. 10~100, 기본값 50. |
출력 변수
| 항목 | 타입 | 값 |
|---|---|---|
| 소리 이름 | 텍스트 | 가장 높은 확률로 인식된 소리의 영문 이름. |
| 소리 확률 | 숫자 | 인식된 소리의 확률, 0~100. |
| 소리 감지 | 디지털 | 특정 소리 여부에서 지정한 소리가 임계값 이상으로 감지되면 참. |
| JSON 결과 | 텍스트 | 모든 인식 결과의 배열. |
JSON 출력
결과마다 label과 confidence(0~100)를 담은 배열이며 확률이 높은 순서입니다. 동작 인식·손동작 인식과 달리 index 항목이 없습니다.
[
{ "label": "Speech", "confidence": 85 },
{ "label": "Music", "confidence": 10 }
]
521가지 범주의 전체 목록은 YAMNet 의 공식 클래스 표(yamnet_class_map.csv)를 참고합니다.