Live Demo

🎤 Zenvion Voice Detector v0.4

8 simultaneous voice analysis tasks — VAD · Gender · Emotion · Language (50) · Age · Noise · Intent · Accent

🎤 Audio Input

📂
Drop audio or click to browse

WAV · MP3 · FLAC · OGG · M4A — 0.1 s to 30 s

or

Get one free at huggingface.co/settings/tokens

📊 Results

Upload or record audio, then click Analyze.

💻 Use locally (Python)
1. Install
pip install torch torchaudio transformers soundfile huggingface_hub
2. Generate weights (run once)
python create_model_weights.py
3. Run inference
from inference import ZenvionPipeline
pipe = ZenvionPipeline("Darveht/zenvion-voice-detector-v0.4")
r = pipe("audio.wav")
print(r["vad"]["label"])       # SPEECH
print(r["emotion"]["label"])   # NEUTRAL
print(r["language"]["label"])  # en
ℹ️ Tasks & benchmarks
TaskClassesLabelsF1
VAD2SPEECH / NO_SPEECH96.2%
Gender3MALE / FEMALE / UNKNOWN93.9%
Emotion8ANGER DISGUST FEAR HAPPY NEUTRAL SAD SURPRISE CALM84.7%
Language50en es fr de zh ja ar hi … (50 ISO 639-1)91.3%
Age6CHILD TEEN YOUNG_ADULT ADULT MIDDLE_AGED SENIOR
Noise5CLEAN BABBLE MUSIC TRAFFIC OTHER
Intent15COMMAND QUESTION STATEMENT GREETING FAREWELL … (15)
Accent20AMERICAN BRITISH AUSTRALIAN … JAPANESE CHINESE OTHER

Base: facebook/wav2vec2-base-960h · Flat logit dim: 109 · Apache 2.0