Multimodal (çok kipli) AI, birden fazla veri türünü — metin, görsel, ses, video — aynı model içinde anlayabilen ve üretebilen sistemdir. Bir fotoğraftaki tabloyu okuyup özetleyebilir, sesli soruya görselle cevap verebilir.
GPT-4o, Gemini ve Claude'un güncel sürümleri multimodaldir. Pratik karşılığı büyük: fatura fotoğrafından veri çıkarma, ekran görüntüsünden hata ayıklama, video içeriğini metne dökme gibi işler tek modelle yapılabilir hâle geldi.