meta/llama-4-maverick-instruct
Generates text responses based on prompts using a multimodal language model with mixture-of-experts architecture. Built...
Found 180 models (showing 161-180)
Generates text responses based on prompts using a multimodal language model with mixture-of-experts architecture. Built...
Generates text responses to prompts using a 17 billion parameter mixture-of-experts language model with 16 experts. Feat...
Generates text responses from text, image, and video inputs using a multimodal reasoning model. Processes questions abou...
Generates text responses from text, image, and video inputs using a 35B-parameter multimodal reasoning model optimized b...
Process text, images, audio, and video inputs to generate text and speech responses simultaneously. Features a novel Thi...
Generates text responses based on text, image, or video inputs with strong multimodal reasoning capabilities. Handles vi...
Calculates similarity scores between an input image and multiple text descriptions using OpenAI's CLIP (Contrastive Lang...
Classify images using candidate text labels through a multimodal vision-language model. Takes an image and comma-separat...
Classifies images based on input image content.
Caption multiple images in batch using GPT, Claude, or Gemini models. Processes ZIP archives containing png, jpg, jpeg,...
Analyzes images and answers questions about them based on text prompts. This small 1.86B parameter vision-language model...
Generate text responses from text prompts and optional image inputs using Google's open-weight vision-language model. Su...
Generates text prompts from input images to help create detailed descriptions for image generation models.
Performs image inpainting by filling in masked areas based on text prompts, or generates text prompts by analyzing maske...
Analyzes chest X-ray images for medical assessment. Takes grayscale medical images as input and provides diagnostic anal...
Generates text and analyzes images based on prompts, with a 1 million token context window. Excels at code generation, c...
Generate text responses from prompts with frontier-level coding and agentic capabilities at mid-tier pricing. Excels at...
Generate text, code, translations, and answers to questions from text and image inputs. Part of OpenAI's GPT-5.6 family,...
Analyzes text and images for DFK (likely content policy) violations using parallel LLM-based classification with configu...
Analyzes images and text prompts to detect content policy violations including public figures, copyright concerns, and N...