Définition·
Capacités

Multimodal

Capacité d'un modèle d'IA à comprendre et générer plusieurs modalités (texte, image, audio, vidéo) au sein d'un même système.

Explication détaillée

Un modèle multimodal accepte par exemple une image + un texte et produit une réponse écrite, ou un texte et produit une vidéo. Cette unification ouvre des cas d'usage riches : analyse de captures d'écran, vision-langage en robotique, assistants vocaux complets.

Exemples

GPT-4o qui voit et entend
Gemini multimodal
Claude 3.5 lisant des PDF illustrés
Sora pour la vidéo

Questions fréquentes

Tous les LLM sont-ils multimodaux ?

Non : certains restent texte-only. Les modèles multimodaux gagnent du terrain mais sont plus coûteux.

Termes associés

Dernière mise à jour : 15/07/2026

Talent AI

Passez de la théorie à la pratique

Publiez une mission ou rejoignez la communauté des meilleurs experts IA, Data et Machine Learning.