🎤 Audio Input
📂
Drop audio or click to browse
WAV · MP3 · FLAC · OGG · M4A — 0.1 s to 30 s
or
Get one free at huggingface.co/settings/tokens
📊 Results
Upload or record audio, then click Analyze.
💻 Use locally (Python)
1. Install
pip install torch torchaudio transformers soundfile huggingface_hub2. Generate weights (run once)
python create_model_weights.py3. Run inference
from inference import ZenvionPipeline
pipe = ZenvionPipeline("Darveht/zenvion-voice-detector-v0.4")
r = pipe("audio.wav")
print(r["vad"]["label"]) # SPEECH
print(r["emotion"]["label"]) # NEUTRAL
print(r["language"]["label"]) # en
ℹ️ Tasks & benchmarks
| Task | Classes | Labels | F1 |
|---|---|---|---|
| VAD | 2 | SPEECH / NO_SPEECH | 96.2% |
| Gender | 3 | MALE / FEMALE / UNKNOWN | 93.9% |
| Emotion | 8 | ANGER DISGUST FEAR HAPPY NEUTRAL SAD SURPRISE CALM | 84.7% |
| Language | 50 | en es fr de zh ja ar hi … (50 ISO 639-1) | 91.3% |
| Age | 6 | CHILD TEEN YOUNG_ADULT ADULT MIDDLE_AGED SENIOR | — |
| Noise | 5 | CLEAN BABBLE MUSIC TRAFFIC OTHER | — |
| Intent | 15 | COMMAND QUESTION STATEMENT GREETING FAREWELL … (15) | — |
| Accent | 20 | AMERICAN BRITISH AUSTRALIAN … JAPANESE CHINESE OTHER | — |
Base: facebook/wav2vec2-base-960h · Flat logit dim: 109 · Apache 2.0