Немного об истоках
Несмотря на то, что работам по созданию ИИ уже три четверти века, эра современного ИИ началась совсем недавно, в 2012 году, когда, по сути, было изобретено глубокое обучение искусственных нейронных сетей. После этого события стали развиваться лавинообразно, разрастаясь, словно снежный ком. Началось широкое внедрение технологий ИИ.
Современные чат-боты с ИИ стали разрабатывать уже с 2016 года, но прорыв произошёл, когда исследовательское подразделение компании Google — Google Brain (входило в состав Google Research) в 2017 году представило архитектуру глубоких нейросетей, получившую название «трансформер», которая легла в основу больших языковых моделей (LLM). Не менее революционную роль в их создании сыграло изобретение в 2018 году предобучения трансформеров, приведшее в том же году к созданию компанией OpenAI первой модели GPT (Generative Pre-trained Transformer — генеративный предобученный трансформер).
Годом же рождения ИИ в его современной форме может считаться 2020 год, когда OpenAI выпустила третье поколение системы обработки естественного языка на основе большой языковой модели — GPT-3, которая впервые по-настоящему продемонстрировала человекоподобные черты. Основанный на ней ChatGPT, запущенный 30 ноября 2022 года, мгновенно приобрёл статус глобального феномена. С этого момента ИИ стал доступен широкой аудитории, что оказалось важным этапом в его развитии. Данный ИИ был обучен на огромных объёмах текстов и мог общаться с пользователями «по-человечески», отвечая на вопросы по широкому кругу тем в текстовом виде.
ChatGPT спустил лавину, и уже в 2023 году в массовый доступ ворвались сразу несколько генеративных ИИ, способных понимать контекст и писать тексты в ответ на запросы. Свои чат-боты выпустили компании Google (Bard, быстро переименованный в Gemini), Яндекс (YandexGPT, затем Alice AI, внедрён также в интеллектуальный помощник «Алиса»), Anthropic (Claude) и Сбер (GigaChat). К слову, видимо, именно их общий ошеломляющий успех привёл к присуждению Нобелевской премии за 2024 год основоположникам глубокого обучения. Справедливости ради отметим, что генеративный ИИ Gato от компании DeepMind появился чуть раньше, в мае 2022 года, но он никогда не был общедоступным.
Одновременно шло развитие мультимодальности ИИ. В данном контексте модальности — это формы представления или типы получаемой информации. Их можно назвать различными «органами чувств» нейросети, которые позволяют ей воспринимать мир. К основным модальностям относят: текст (слова, символы, код), изображения (фотографии, картинки, схемы, чертежи), аудио (речь, музыка, шумы), видео, сенсорные данные (показания датчиков).
Изначально каждая модальность обрабатывалась отдельными, слабо связанными нейросетями. К слову, первые чат-боты были текстовыми. Но в 2020 году исследователи всё той же Google Brain разработали ViT (Vision Transformer), показав, что изображения можно обрабатывать тем же трансформером, что и текст. Это открыло путь к единой архитектуре, и уже в 2021 году ИИ трудами компании OpenAI сначала научился предсказывать, какой текст соответствует какому изображению (CLIP), а затем и генерировать изображения по тексту (DALL-E). Успех следовал за успехом, и к 2023 году произошёл прорыв в работе одновременно с несколькими модальностями, породивший взрыв генеративных возможностей ИИ...

