A generative pre-trained transformer (GPT) is a large language model architecture that generates text by predicting the next token, pre-trained on vast text and then adapted to specific tasks. In visual AI its relevance comes through vision-language models that extend the same recipe to images.
| Term | What it is |
|---|---|
| GPT | A text-generating transformer, pre-trained then adapted |
| Large language model (LLM) | The broader class of large text models GPT belongs to |
| Vision language model (VLM) | A model that takes images and text, the GPT recipe extended to vision |
