Словарь терминов
Глоссарий терминов AI, LLM, теории информации и философии сознания
$ grep -r "" ./glossary/ | wc -l
70 терминов
#
LLM (Large Language Model)
Большая языковая модель — нейросеть с миллиардами параметров, обученная на огромных корпусах текста для генерации, понимания и преобразования естественного языка.
#
Transformer
Архитектура нейросети, предложенная в 2017 году в статье «Attention Is All You Need». Отказывается от рекуррентных слоёв в пользу механизма самовнимания, что обеспечивает полную параллелизацию вычислений.
#
Self-Attention (самовнимание)
Механизм, позволяющий каждому токену в последовательности «посмотреть» на все остальные токены и собрать контекстную информацию. Ключевой компонент архитектуры Transformer.
#
Энтропия (Шеннона)
Мера неопределённости или непредсказуемости случайной величины. В теории информации — математическое ожидание количества информации, которое несёт источник сообщений.
#
Информация (по Шеннону)
Мера неожиданности события: I = −log₂(p), где p — вероятность. Чем менее вероятно событие, тем больше информации оно несёт. Измеряется в битах.
#
Теория информации Шеннона
Математическая теория (1948), определяющая информацию через вероятность событий. Фундамент для сжатия данных, криптографии, сетевых протоколов и обучения нейросетей.
#
Эмбеддинг (вложение)
Представление слова или токена в виде числового вектора в многомерном пространстве, где близкие по смыслу слова находятся рядом. Статические (Word2Vec) фиксированы, контекстные — меняются от окружения.
#
RNN (рекуррентная нейронная сеть)
Класс нейросетей, обрабатывающих последовательности пошагово, передавая скрытое состояние от шага к шагу. Страдают от проблемы исчезающего градиента на длинных последовательностях.
#
LSTM (Long Short-Term Memory)
Разновидность RNN с механизмом «вентилей» (gates), решающая проблему исчезающего градиента. Была стандартом в NLP до появления Transformer.
#
Токен
Базовая единица текста для языковой модели. Может соответствовать слову, части слова или символу. Контекстное окно LLM измеряется в токенах.
#
Инференс
Процесс использования обученной модели для получения предсказаний. В контексте LLM — генерация ответа на промпт пользователя.
#
N-грамма
Последовательность из n подряд идущих элементов в тексте. N-граммные модели оценивают вероятность следующего элемента на основе нескольких предыдущих — первый подход к моделированию языка.
#
Обратное распространение ошибки
Алгоритм обучения нейросетей, вычисляющий градиенты функции потерь по всем весам от выходного слоя к входному. Основа обучения всех современных глубинных моделей.
#
RLHF
Reinforcement Learning from Human Feedback — метод дообучения модели на основе оценок качества ответов, данных людьми. Ключевая технология, сделавшая ChatGPT удобным.
#
Few-shot learning
Способность модели решать задачу по нескольким примерам в промпте без дополнительного обучения весов. Впервые продемонстрировано в масштабе в GPT-3.
#
Multi-Head Attention
Расширение Self-Attention: несколько параллельных «голов» одновременно анализируют текст с разных точек зрения, затем объединяют результаты.
#
Softmax
Функция активации, превращающая вектор чисел в распределение вероятностей (все положительные, в сумме единица). Используется в механизме внимания для вычисления весов.
#
Cross-entropy loss
Функция потерь, измеряющая расхождение между предсказанным и истинным распределениями вероятностей. Стандартная функция потерь при обучении LLM, напрямую связана с теорией Шеннона.
#
KV-кэш
Кэширование ключей (Key) и значений (Value) ранее обработанных токенов при авторегрессивной генерации. Позволяет не пересчитывать внимание к предыдущим токенам на каждом шаге.
#
Цепь Маркова
Вероятностная модель, где следующее состояние зависит только от текущего. Впервые применена А. А. Марковым к тексту в 1913 году — первый шаг к моделированию языка.
#
Seq2seq
Архитектура нейросети, преобразующая входную последовательность в выходную. Механизм внимания был впервые введён именно в seq2seq-моделях для машинного перевода.
#
Квадратичная сложность O(n²)
Вычислительная сложность Self-Attention: при увеличении длины последовательности в n раз вычисления растут в n² раз. Главная причина ограничения контекстного окна.
#
Mixture of Experts (MoE)
Архитектурный паттерн: модель состоит из множества «экспертов», а механизм маршрутизации выбирает, какие активировать для каждого токена.
#
State Space Models (SSM)
Класс архитектур (например, Mamba), альтернативных Transformer, с линейной сложностью по длине последовательности.
#
GPU
Графический процессор с тысячами параллельных ядер — основная платформа для обучения и инференса нейросетей. Революция AlexNet (2012) показала их эффективность.
#
Observability (наблюдаемость)
Способность понимать внутреннее состояние системы по внешним проявлениям — логам, метрикам, трейсам. Инструменты: Prometheus, Grafana, Loki.
#
Self-hosting
Запуск ПО на собственном оборудовании, а не на облачных платформах. В контексте ИИ — локальный запуск LLM через Ollama, vLLM, LM Studio.
#
Открытый индивидуализм
Философская позиция (Д. Колак): существует один субъект опыта, проявляющийся во всех сознательных существах. Границы между «я» и «другими» — информационная иллюзия.
#
Закрытый индивидуализм
Интуитивная позиция: у каждого существа своё отдельное «я», изолированное от других. Аналог — изолированный сервер за фаерволом.
#
Пустой индивидуализм
Позиция, отрицающая постоянное «я»: есть только дискретные моменты опыта, связанные памятью. Аналог — stateless-сервис.
#
Трудная проблема сознания
Проблема (Д. Чалмерс, 1995): почему физические процессы в мозге сопровождаются субъективным опытом. Ни одна теория не даёт общепризнанного ответа.
#
Феноменальное сознание
Субъективный опыт — то, «каково это» что-то ощущать. Отличается от функционального доступа к информации.
#
Alignment (выравнивание ИИ)
Задача настройки ценностей и поведения ИИ так, чтобы они соответствовали интересам людей. Включает RLHF, constitutional AI и философские вопросы.
#
Тьюринг-тест
Тест машинного интеллекта (А. Тьюринг, 1950): человек общается текстом и должен определить, кто из собеседников — машина.
#
Word2Vec
Модель (T. Mikolov, Google, 2013), показавшая, что векторы слов улавливают семантику: «король − мужчина + женщина ≈ королева». Кардинально упростила подход к эмбеддингам.
#
Function calling (вызов функций)
Механизм, позволяющий языковой модели сообщить о намерении вызвать внешнюю функцию с заданными аргументами (в виде структурированного JSON). Модель не исполняет функцию сама — это делает окружение. Выбор функции сводится к семантическому сопоставлению запроса с описаниями через Self-Attention.
#
Model Context Protocol (MCP)
Открытый клиент-серверный протокол (Anthropic, 2024) поверх JSON-RPC, стандартизирующий подключение приложений (хостов/клиентов) к источникам данных и инструментам (серверам). Метафора — USB-C для LLM: один стандартный интерфейс для любого источника.
#
Агент (AI agent)
Архитектура поверх LLM, способная автономно планировать многошаговые последовательности вызовов инструментов, исправлять собственные ошибки и решать, когда остановиться. В отличие от разового function calling, агент ведёт цикл «восприятие → действие → оценка».
#
Ollama
Популярный инструмент для локального запуска LLM (Llama, Mistral, Qwen и др.) на собственном железе без облака. Упрощает загрузку весов, квантование и инференс через единый CLI/API.
#
RAG (Retrieval-Augmented Generation)
Паттерн, при котором перед генерацией ответа LLM получает релевантный контекст, извлечённый из внешней базы знаний (чаще — векторным поиском по эмбеддингам). Снижает галлюцинации и даёт модели доступ к актуальным или приватным данным, не входившим в обучение.
#
Векторная база данных
БД, оптимизированная для хранения и поиска по векторам (эмбеддингам). Поиск ближайших соседей (ANN) находит векторы, ближайшие к запросу по косинусному/евклидову расстоянию. Примеры: pgvector, Pinecone, Qdrant, Milvus.
#
HNSW (Hierarchical Navigable Small World)
Алгоритм приближённого поиска ближайших соседей (ANN) в векторном пространстве. Строит многослойный граф, по которому быстро «спускается» к ближайшим векторам. Стандарт де-факто в pgvector и большинстве векторных БД: точность ~exact-поиска при на порядки меньшем времени.
#
SSE (Server-Sent Events)
Протокол однонаправленной потоковой передачи данных от сервера к браузеру поверх HTTP. Удобен для стриминга токенов LLM в реальном времени: сервер держит соединение открытым и шлёт события по мере генерации. Проще WebSocket, когда обратный канал не нужен.
#
BGE-M3
Эмбеддинг-модель (BAAI, 2024): 1024-мерные векторы, мультиязычная. Эталон open-source эмбеддингов; часто запускается локально (CPU/GPU) для приватных RAG-систем.
#
Reranking (переранжирование)
Второй этап поиска в RAG: кандидатные документы, найденные быстрым векторным поиском, переоцениваются более тяжёлой cross-encoder моделью, которая читает запрос и документ совместно. Повышает точность итогового top-k за счёт дополнительной вычислительной стоимости.
#
Fine-tuning (дообучение)
Дообучение предварительно обученной модели на узком датасете путём корректировки весов через обратное распространение ошибки. Учит модель стилю или формату ответов, но плохо подходит для запоминания конкретных фактов — для этого используют RAG.
#
Градиентный спуск
Алгоритм оптимизации: веса модели корректируются в направлении, противоположном градиенту функции потерь, чтобы уменьшить ошибку. Основа обучения практически всех нейросетей и многих классических моделей. Варианты: batch, mini-batch, stochastic.
#
Линейная регрессия
Классический метод прогнозирования: подбирает линейную функцию (прямую/гиперплоскость), минимизирующую сумму квадратов отклонений от данных. Прародитель всего машинного обучения; основа скоринга, прогноза, аналитики. Проста и интерпретируема.
#
Логистическая регрессия
Метод классификации (вопреки названию): через сигмоиду отображает линейную комбинацию признаков в вероятность класса (0..1). Десятилетиями — стандарт бинарной классификации (спам/не-спам, кредитный риск).
#
Градиентный бустинг (XGBoost, LightGBM)
Ансамблевый метод: деревья решений строятся последовательно, каждое следующее предсказывает и корректирует ошибки (градиент) предыдущих. Доминирует в задачах на табличных данных и до сих пор превосходит нейросети на структурированных признаках.
#
Случайный лес (Random Forest)
Ансамбль из множества решающих деревьев, обученных на случайных подмножествах данных и признаков; итоговый ответ — голосование большинства. Устойчив к переобучению, мало требует настройки, хорошо работает «из коробки».
#
k-ближайших соседей (k-NN)
Простой метод: объект классифицируется по большинству среди k его ближайших соседей в пространстве признаков. Не требует обучения (lazy learning), но дорог при инференсе на больших данных. База рекомендательных систем и прототипов.
#
Метод опорных векторов (SVM)
Метод классификации: ищет гиперплоскость с максимальным зазором между классами. Через kernel trick работает и в нелинейных случаях, проецируя данные в пространство более высокой размерности. Стандарт до эпохи глубокого обучения.
#
PCA (метод главных компонент)
Метод снижения размерности: находит направления (главные компоненты) максимального разброса данных и проецирует точки на них. Убирает шум и избыточность, ускоряет обучение, помогает визуализировать многомерные данные.
#
k-means (к-средних)
Алгоритм кластеризации без учителя: делит данные на k групп, минимизируя сумму расстояний от точек до центров (центроидов) своих кластеров. Прост и быстр; используется в сегментации клиентов, сжатии, разведочном анализе.
#
Переобучение (overfitting)
Слишком точная подгонка под обучающие данные, после чего модель теряет обобщающую способность и плохо работает на новых примерах. Главная болезнь ML; лечат регуляризацией, кросс-валидацией, увеличением данных и ранней остановкой.
#
Свёрточная нейросеть (CNN)
Архитектура для обработки данных с сеточной структурой (изображения, аудиоспектры): скользит небольшими фильтрами, находя локальные узоры — от краёв к фигурам и объектам. Революционизировала компьютерное зрение (LeNet → ResNet).
#
GAN (Generative Adversarial Network)
Архитектура генерации (Гудфеллоу, 2014): генератор подделывает данные, дискриминатор отличает подделку от настоящей, обе сети соревнуются и улучшаются. Дала первые фотореалистичные лица, но капризна в обучении (mode collapse).
#
Вариационный автокодировщик (VAE)
Генеративная модель: кодировщик сжимает данные в вероятностное распределение скрытого пространства, декодер восстанавливает. Сэмплы из этого пространства порождают новые объекты. Результаты «гладкие», но менее чёткие, чем у GAN/диффузии.
#
Диффузионная модель
Генеративная модель: учится пошагово убирать шум из зашумлённого изображения. Запуск процесса из чистого шума порождает осмысленный объект. Основа Stable Diffusion, DALL-E, Midjourney — стабильнее GAN, лучше следует текстовому промпту.
#
Q-обучение
Метод обучения с подкреплением: агент учится функции Q(state, action) — ожидаемой суммарной награде. Работает для маленьких пространств состояний; для больших таблицу заменяют нейросетью (Deep Q-Network).
#
PPO (Proximal Policy Optimization)
Алгоритм обучения с подкреплением (OpenAI): обновляет стратегию маленькими шагами, обрезая изменение вероятностей действий, чтобы не разрушить уже выученное. Стандарт для дообучения LLM через RLHF.
#
MCTS (поиск по дереву Монте-Карло)
Алгоритм планирования: разворачивает дерево возможных будущих действий через случайные симуляции и выбирает перспективные ветви. В связке с нейросетями позволил AlphaGo победить чемпиона мира по Go (2016).
#
Квантование (quantization)
Оптимизация модели: уменьшает точность чисел (16→8→4 бита), экономя память и скорость при небольшой потере качества. Ключ к запуску LLM на потребительском железе через GGUF/Ollama.
#
Прунинг (pruning)
Оптимизация модели: удаляет «лишние» веса или нейроны с минимальным влиянием на выход, уменьшая размер и ускоряя инференс. Часто комбинируется с квантованием; бывает структурированным (целые слои) и неструктурированным.
#
Self-supervised learning
Обучение на неразмеченных данных через сформулированные самой задачей pretext-цели (предскажи следующее слово, восстанови закрытую часть). Позволяет учиться на терабайтах без ручной разметки — именно так обучаются все современные LLM.
#
Обучение с подкреплением (RL)
Парадигма ML: агент учится через взаимодействие со средой, получая награды/штрафы за действия, а не на готовых метках. Так учатся играть в шахматы/Go и так проводится RLHF-дообучение LLM следовать инструкциям.
#
YOLO (You Only Look Once)
Архитектура детекции объектов: одна нейросеть за один проход по картинке находит все объекты и рисует рамки. Насколько быстрая, что работает в реальном времени на видео; стандарт для детекции, где важна скорость.
#
BERT
Языковая модель (Google, 2018) на основе энкодера трансформера: читает текст двунаправленно, отлично справляется с пониманием (QA, классификация). Открыл эру предобучения+fine-tuning в NLP; идейный близнец GPT, но для анализа, а не генерации.
#
GPT (Generative Pre-trained Transformer)
Семейство авторегрессионных языковых моделей (декодер трансформера): предсказывают следующий токен один за другим. GPT-путь (OpenAI) привёл к ChatGPT и всей эре LLM — генерация, а не понимание, как у BERT.