AI Endpoints
Easily access world-renowned pre-trained AI models.
Innovate with simple and secure APIs on OVHcloud's robust and confidential infrastructure. Optimize your applications with scalable AI capabilities, eliminating the need for deep expertise. Gain efficiency with powerful AI Endpoints, designed for simplicity and reliability.
Discover our models
Explore our catalog of artificial intelligence models to find the one that fits your needs.
Filters
Context
All
19 results available
Qwen3.6-27B
0.4€
/Mtoken(input)2.7€
/Mtoken(output)Licence: Apache 2.0
Number of params: 27B
Quantization: fp8
Max. context size: 262K
Support: Function calling, Multimodal, Reasoning
Qwen3.5-397B-A17B
0.6€
/Mtoken(input)3.6€
/Mtoken(output)Licence: Apache 2.0
Number of params: 397B
Quantization: fp8
Max. context size: 262K
Support: Function calling, Multimodal, Reasoning
Qwen3.5-9B
0.1€
/Mtoken(input)0.15€
/Mtoken(output)Licence: Apache 2.0
Number of params: 9.7B
Quantization: bf16
Max. context size: 262K
Support: Function calling, Multimodal, Reasoning
Qwen3-Embedding-8B
0.1€
/Mtoken(input)Qwen3Guard-Gen-8B
Free
Licence: Apache 2.0
Number of params: 8B
Quantization: fp16
Max. context size: 32K
Support: Moderation
Qwen3Guard-Gen-0.6B
Free
Licence: Apache 2.0
Number of params: 0.6B
Quantization: fp16
Max. context size: 32K
Support: Moderation
gpt-oss-120b
0.08€
/Mtoken(input)0.4€
/Mtoken(output)Licence: Apache 2.0
Number of params: 117B
Quantization: fp4
Max. context size: 131K
Support: Function calling, Reasoning
gpt-oss-20b
0.04€
/Mtoken(input)0.15€
/Mtoken(output)Licence: Apache 2.0
Number of params: 21B
Quantization: fp4
Max. context size: 131K
Support: Function calling, Reasoning
whisper-large-v3-turbo
0.00001278€
/secondLicence: Apache 2.0
Number of params: 0.81B
Quantization: fp16
Support: Automatic Speech Recognition
whisper-large-v3
0.00004083€
/secondLicence: Apache 2.0
Number of params: 1.54B
Quantization: fp16
Support: Automatic Speech Recognition
Meta-Llama-3_3-70B-Instruct
0.67€
/Mtoken(input)0.67€
/Mtoken(output)Licence: Llama 3.3 Community
Number of params: 70B
Quantization: fp8
Max. context size: 131K
Support: Function calling
Qwen2.5-VL-72B-Instruct
0.91€
/Mtoken(input)0.91€
/Mtoken(output)Licence: Qwen
Number of params: 72B
Quantization: fp8
Max. context size: 32K
Support: Multimodal