zsxkib/kimi-audio-7b-instruct
Processes audio input to perform multiple audio tasks including speech-to-text transcription, audio captioning, emotion...
Found 7 models (showing 1-7)
Processes audio input to perform multiple audio tasks including speech-to-text transcription, audio captioning, emotion...
Analyzes audio input to identify and classify music characteristics, returning text labels with configurable confidence...
Analyzes audio files or YouTube URLs to classify music approachability and engagement levels. Uses EfficientNet embeddin...
Classify music style and genre from audio. Accepts an audio file or YouTube link and predicts the top-N Discogs styles (...
Classify music by genre, mood, and instrumentation from an audio file or YouTube URL. Analyze audio using transfer-learn...
Classify music into up to 400 styles from an audio file or YouTube link, returning the top-N predictions as a bar-chart...
Classify speaker gender from an audio file. Accepts a speech audio clip and returns probabilities for male and female cl...