Which inputs and outputs matter?
Distinguish image understanding, image generation, OCR, visual question answering, and audio. The domain labels are not interchangeable.
Purpose guide · Multimodal
Catalog current through July 21, 2026
Source-backed models whose Epoch records explicitly include a multimodal, vision, image, or audio domain. This is a capability map, not a quality ranking.
Selection rule
Included when the Epoch record explicitly lists multimodal, vision, image generation, or audio as a domain. Domain membership does not prove support for every media type or task.
Task-fit shortlist
Ordered by release date for readability, newest first. The order is not a score or recommendation.
Released June 2, 2026
Released April 1, 2026
Released March 29, 2026
Released March 29, 2026
Released February 13, 2026
Released February 12, 2026
Released September 22, 2025
Released August 4, 2025
Released June 11, 2025
Released May 11, 2025
Released March 16, 2025
Released January 22, 2025
Released December 5, 2024
Released December 3, 2024
Released November 25, 2024
Released November 11, 2024
Released October 22, 2024
Released October 22, 2024
Released October 22, 2024
Released September 24, 2024
Released June 28, 2024
Released January 25, 2024
Released November 14, 2023
Released November 7, 2023
Released October 27, 2023
Released October 17, 2023
Released September 28, 2023
Released August 24, 2023
Released January 5, 2023
Released November 2, 2022
Released August 22, 2022
Released June 13, 2022
Released December 31, 2021
Released November 22, 2021
Released March 5, 2021
Released December 12, 2018
Released July 10, 2018
Released December 1, 2017
Released October 27, 2017
Released September 17, 2016
Released December 10, 2015
Released December 10, 2015
Released December 10, 2015
Released June 4, 2015
Released April 30, 2015
Released February 6, 2015
Released September 18, 2014
Released January 1, 1963
Decision criteria
These checks narrow an evaluation plan. They do not replace hands-on testing.
Distinguish image understanding, image generation, OCR, visual question answering, and audio. The domain labels are not interchangeable.
Test the full handoff between text, files, images, and tools. A multimodal label alone does not establish format support or reliable cross-modal reasoning.
Evaluate media quality, instruction following, file limits, safety, latency, and cost on representative assets. Those measurements are not in this catalog.
Evidence boundary
No task-level quality, price, context window, latency, or reliability measurement is present in the Epoch catalog. We therefore publish no ranking or “best” label.
Catalog source: Epoch AI Data on AI Models, retrieved 2026-07-21, CC-BY. Artifact sha256:80ad08198183693101ceb246a5ea272d64c06c147fc41f72cca8526b32483424.
Each listed model links to its model-level source above. See the publication source ledger and methodology for the wider evidence policy.