Fig.1

Concept

Multi-Modal Diffusion Transformer

A Multi-Modal Diffusion Transformer (MMDiT) is a diffusion model backbone that processes two or more input modalities (for example text and images) as separate token streams inside one transformer, rather than encoding one modality into a fixed conditioning vector. It became…

The rest of “Multi-Modal Diffusion Transformer” is a premium feature: every concept in the library gets a precise, practitioner-focused write-up like this one, cross-linked straight from the paper summaries that use it.

Log in to unlock

← Back to the library