Multimodale Systeme sind darauf ausgelegt, mehrere Arten von Eingaben und Ausgaben miteinander zu verbinden. Sie können zum Beispiel Text mit Bildern verknüpfen oder Sprache und visuelle Inhalte gemeinsam interpretieren.
Viele reale Situationen bestehen nicht nur aus Text. Durch die Verarbeitung mehrerer Modalitäten können KI-Systeme komplexere Zusammenhänge verstehen und natürlicher mit Menschen interagieren.
Multimodale KI wird etwa in Assistenzsystemen, Dokumentenanalyse, visueller Suche oder bei Audio-Video-Anwendungen eingesetzt. Sie gilt als ein zentraler Entwicklungsschritt moderner KI-Systeme.