Языковая модель — то, что стоит за ChatGPT, Gemini и Claude, за автоответчиком в чате и за подсказками в почте. Разбираем без формул: как она устроена, почему уверенно ошибается, что такое токены и контекст, чем модели отличаются друг от друга и что из этого важно знать, если вы собираетесь применять их в работе.

1. Что это такое простыми словами

Языковая модель — программа, которая обучена на огромном объёме текстов и умеет продолжать текст. Вы даёте начало — она выдаёт продолжение. Всё остальное, включая ответы на вопросы, перевод, пересказ и написание кода, — частные случаи этого умения.

Аббревиатура LLM расшифровывается как large language model, «большая языковая модель». Большая — про количество параметров, внутренних настроек, которые модель подобрала во время обучения. У современных моделей их сотни миллиардов.

Чем модель отличается от чат-бота

Модель — двигатель. Чат-бот, ассистент в почте, помощник в редакторе — это оболочки вокруг неё: интерфейс, память переписки, доступ к вашим данным, правила поведения. Одна и та же модель может стоять в десяти разных продуктах и вести себя по-разному, потому что вокруг неё разная обвязка.

2. Как она работает: предсказание следующего слова

Механика проще, чем кажется. Модель раз за разом предсказывает, какой фрагмент текста вероятнее всего идёт следующим, и дописывает его. Потом снова — с учётом уже написанного. Так по кусочку собирается ответ.

Из этого следуют два важных вывода. Первый: модель не «понимает» текст так, как человек, — она оперирует статистикой языка. Второй: у неё нет базы фактов, из которой она достаёт ответ. Она порождает правдоподобный текст, и совпадение с истиной обеспечивается тем, что в обучающих данных правда встречалась чаще выдумки. Обычно этого достаточно, иногда — нет.

Почему один и тот же вопрос даёт разные ответы

В генерации заложена случайность: из нескольких подходящих продолжений выбирается одно с учётом вероятностей. Степень случайности регулируется настройкой, которую в интерфейсах называют «температурой». Ниже температура — стабильнее и суше ответы, выше — разнообразнее и рискованнее.

3. Токены, контекст и почему это влияет на счёт

Токены

Модель работает не с буквами и не со словами, а с токенами — кусочками текста. Один токен это примерно 0,7 слова для русского языка. Миллион токенов — около семисот тысяч слов, то есть несколько толстых книг.

Оплата в сервисах считается именно в токенах, отдельно за ввод и за вывод. На август 2026 у флагманских моделей ввод стоит порядка нескольких долларов за миллион токенов, а вывод в несколько раз дороже; у облегчённых версий — десятки центов. Практический вывод: длинные диалоги и большие документы стоят денег, и на этом строится вся экономия при промышленном использовании.

Контекстное окно

Это объём текста, который модель удерживает одновременно: ваш вопрос, история переписки, приложенные документы и её собственный ответ. Всё, что вышло за границу окна, для модели не существует — отсюда ощущение, что в длинном диалоге ассистент «забыл» сказанное вначале.

У современных моделей окно большое, но это не значит, что туда нужно грузить всё подряд: чем больше лишнего, тем дороже запрос и тем выше шанс, что важное потеряется среди второстепенного.

4. Как модель обучают

Три стадии, о которых полезно знать, чтобы понимать границы возможностей.

  1. Предобучение. Модель читает гигантские объёмы текста и учится предсказывать продолжение. Это самая дорогая часть: месяцы вычислений и миллионы долларов. Именно здесь формируется знание о мире — и именно оно устаревает, потому что данные собраны до определённой даты.
  2. Дообучение на инструкциях. Модель учат отвечать на просьбы, а не просто продолжать текст.
  3. Настройка по человеческим оценкам. Люди сравнивают варианты ответов, модель подстраивается под предпочтения: быть полезной, не грубить, не выдавать опасное.

Компания, которая хочет применить модель у себя, в это не вмешивается. Ей доступны более простые пути: дать инструкции в запросе, подключить свои документы или, реже, дообучить готовую модель на своих примерах.

5. Почему модели уверенно врут

Явление называют галлюцинациями: модель выдаёт выдуманный факт тем же тоном, что и достоверный. Причина не в ошибке разработчиков, а в самой конструкции — она порождает вероятное продолжение, а не ищет ответ в справочнике.

Когда риск выше

  • Вопрос о вашей компании: цены, условия, наличие. Модель этого не знает и додумает.
  • Точные цифры, даты, имена, ссылки — самая частая категория выдумок.
  • Узкие профессиональные темы, где в обучающих данных мало материала.
  • События после даты сбора данных.

Что с этим делают на практике

Основной приём — не полагаться на память модели, а давать ей нужные материалы в запросе: прайс, регламент, кусок документа. Тогда ответ строится по ним, и его можно проверить по источнику. Именно так устроены корпоративные ассистенты — подробно разбираем в материале про подключение данных компании.

6. Чем модели отличаются друг от друга

Параметр Что означает на практике
Размер крупные умнее в сложных задачах, мелкие дешевле и быстрее
Контекстное окно сколько документов можно дать за раз
Дата данных что модель знает о мире без подсказок
Языки качество на русском и казахском сильно различается
Открытая или закрытая открытую можно поставить на свой сервер, закрытая доступна по API
Мультимодальность умеет ли работать с картинками, звуком, таблицами
Цена разница между флагманом и лёгкой версией — десятки раз

Отдельный класс — открытые модели с публичными весами: Llama, Qwen, Gemma, Mistral. Их можно развернуть у себя, дообучить и не отдавать данные наружу. Платой за это становится инфраструктура: нужен сервер с видеокартами и человек, который это обслуживает.

7. Как обстоят дела с казахским языком

Ещё недавно казахский был для больших моделей второстепенным: ответы получались с ошибками и кальками. Сейчас положение другое.

  • Google добавил казахский в Gemini — язык вошёл в число новых, поддержанных в поколении Gemini 3.
  • KazLLM — модель, разработанная ISSAI Назарбаев Университета специально под казахский язык.
  • Alem LLM — казахстанская модель на 246 миллиардов параметров, которую заявляют как превосходящую ChatGPT и Gemini в работе с казахским; её планируют сделать общедоступной.

Практический совет: перед тем как строить двуязычного ассистента, прогоните через кандидатов свои реальные тексты — прайс, типовые вопросы клиентов, названия услуг. Бенчмарки показывают средние результаты по языку, а вам нужно качество на вашей терминологии.

8. Как выбрать модель под задачу

  • Простая классификация и короткие ответы. Берите лёгкую модель: она в десятки раз дешевле, а качество на таких задачах сопоставимо.
  • Работа с длинными документами. Смотрите на размер контекстного окна и цену ввода — именно она определит счёт.
  • Чувствительные данные. Открытая модель на своём сервере или корпоративный тариф с запретом на обучение на ваших данных.
  • Двуязычность. Тестируйте на казахском отдельно, не полагайтесь на общее описание «поддерживает 100 языков».
  • Массовые операции. Считайте стоимость на тысячу операций заранее: разница между флагманом и лёгкой моделью на объёме превращается в порядок цифр.

9. Как формулировать запрос, чтобы получать толк

Качество ответа зависит от запроса сильнее, чем от выбора модели. Четыре приёма, которые работают всегда.

  • Дайте роль и задачу. «Ты редактор, приведи текст к деловому тону, сохрани смысл» лучше, чем «улучши текст».
  • Задайте формат. Скажите, что хотите: таблицу, список из пяти пунктов, письмо до 800 знаков. Иначе модель выберет формат сама.
  • Приложите материал. Не «напиши описание нашей услуги», а «вот характеристики и цена, напиши описание по ним». Без материалов модель придумает.
  • Покажите пример. Один-два образца желаемого результата дают эффект сильнее, чем три абзаца объяснений.

Что не работает: вежливость и угрозы, требование «отвечай точно», просьба «не выдумывай» без выданных источников. Модель не может проверить себя — она может только опираться на то, что вы ей дали.

10. Что важно знать перед внедрением

  • Модель не знает вашу компанию. Пока вы не дали ей прайс и регламенты, она отвечает общими словами — и это не лечится выбором «модели поумнее».
  • Ответы нужно проверять. Особенно первые недели и особенно там, где называются цифры и обязательства.
  • Стоимость считается за объём. Пилот на сто диалогов и промышленная работа на десять тысяч — разные бюджеты.
  • Модели меняются каждые несколько месяцев. Стройте решение так, чтобы модель можно было заменить, не переписывая всё.
  • Данные — ваша ответственность. Отправка персональных данных в облачный сервис регулируется законом, и отвечает за это компания.

Мы применяем языковые модели прикладно: собираем ассистентов, которые отвечают по материалам компании, и автоматизируем рутину в связке с CRM. Начинаем не с выбора модели, а с задачи и расчёта — что именно она заменит и сколько это сэкономит. Что даёт ИИ бизнесу и где он не окупается, разбирали в статье про ИИ для бизнеса.