Перейти к основному содержанию

Глоссарий ИИ и API

Короткие определения без маркетинговых формулировок.

Найдено 60 терминов

Бесплатный тариф

Ограниченный доступ без оплаты: лимиты запросов, урезанный список моделей или небольшой тестовый баланс.

Связанные термины: Подписка, Rate limit

Векторная БД

База данных для хранения эмбеддингов и поиска по смысловой близости.

Связанные термины: Embedding, RAG

Галлюцинация

Уверенный по форме, но фактически неверный ответ модели. Риск снижают через RAG и проверку источников.

Связанные термины: RAG, LLM

Латентность

Задержка между отправкой запроса и началом ответа. При работе через прокси обычно выше из-за дополнительного сетевого узла.

Связанные термины: Streaming, Throughput

Модерация контента

Автоматическая проверка запросов и ответов на запрещённый контент; иногда блокирует и безобидные запросы.

Связанные термины: Отказ модели

Открытая модель

Модель с опубликованными весами (Llama, DeepSeek и др.): её можно запускать на собственном оборудовании.

Связанные термины: Self-hosting, LLM

Промпт

Текстовый запрос к модели. Формулировка промпта напрямую влияет на качество и стоимость ответа.

Связанные термины: System prompt, Температура

Ротация ключей

Регулярная замена API-ключей, ограничивающая ущерб при возможной утечке.

Связанные термины: API-ключ

Температура

Параметр случайности генерации: при 0 ответы почти детерминированы, с ростом значения — разнообразнее, но менее стабильны.

Связанные термины: Top-p, Промпт

Токенизация

Разбиение текста на токены. Алгоритмы у моделей различаются, поэтому один и тот же текст даёт разное число токенов.

Связанные термины: Токен

Эндпоинт

URL конкретного метода API, например /v1/chat/completions.

Связанные термины: API, Model ID

API

Программный интерфейс: способ обращаться к модели из кода по HTTP, без веб-интерфейса чата.

Связанные термины: Эндпоинт, API-ключ, SDK

API-ключ

Секретная строка для авторизации запросов. Ключ нельзя публиковать: любой владелец может расходовать ваш баланс.

Связанные термины: API, Ротация ключей

Batch API

Пакетная обработка запросов без требований к скорости: результат в течение часов, обычно вдвое дешевле обычных запросов.

Связанные термины: API, Официальная цена

Embedding

Представление текста числовым вектором: близкие по смыслу тексты получают близкие векторы. Основа семантического поиска и RAG.

Связанные термины: RAG, Векторная БД

Fine-tuning

Дообучение готовой модели на собственных данных под конкретную задачу, стиль или формат ответов.

Связанные термины: LoRA, Открытая модель

Function calling

Механизм, позволяющий модели вызывать описанные разработчиком функции: поиск, базы данных, внешние сервисы.

Связанные термины: API, JSON-режим

GPU

Графический процессор — основное оборудование для запуска нейросетей; определяет скорость и стоимость inference.

Связанные термины: Inference, Self-hosting

Inference

Процесс генерации ответа моделью на входной запрос. Именно за inference берётся плата при использовании API.

Связанные термины: Streaming, Латентность

JSON-режим

Режим, в котором модель обязана вернуть синтаксически корректный JSON — удобно для интеграций и автоматической обработки.

Связанные термины: Function calling, SDK

LLM

Большая языковая модель — нейросеть, обученная на массивах текста и генерирующая ответ токен за токеном.

Связанные термины: Inference, Токен

LoRA

Метод экономного дообучения: обучаются небольшие добавочные матрицы, а не все веса модели.

Связанные термины: Fine-tuning, Self-hosting

Model ID

Уникальный идентификатор модели у провайдера (например, gpt-4o-mini). Указывается в каждом запросе к API.

Связанные термины: API, Эндпоинт

Prompt injection

Атака, при которой вредоносная инструкция внедряется в обрабатываемый текст и меняет поведение модели.

Связанные термины: System prompt, Джейлбрейк

RAG

Архитектура, при которой модель получает выдержки из внешней базы знаний и отвечает с опорой на них, а не только на обучение.

Связанные термины: Embedding, Векторная БД

Rate limit

Ограничение числа запросов или токенов за интервал времени. При превышении API возвращает ошибку 429.

Связанные термины: RPM, TPM

Reasoning-модель

Модель, строящая перед ответом внутреннюю цепочку рассуждений. Точнее в сложных задачах, но расходует больше выходных токенов.

Связанные термины: LLM, Выходные токены

RPM

Requests per minute — допустимое число запросов к API в минуту; одна из составляющих rate limit.

Связанные термины: Rate limit, TPM

SDK

Готовая библиотека для работы с API на конкретном языке программирования: скрывает детали HTTP-запросов.

Связанные термины: API, OpenAI-совместимый API

Self-hosting

Запуск открытой модели на собственном или арендованном сервере вместо обращения к облачному API.

Связанные термины: GPU, Открытая модель

Streaming

Режим получения ответа по частям, токен за токеном, в реальном времени — не дожидаясь полной генерации.

Связанные термины: Inference, Латентность

System prompt

Служебная инструкция, задающая модели роль и правила ответа. Передаётся отдельно от сообщений пользователя, оплачивается как входные токены.

Связанные термины: Промпт, Prompt injection

Top-p

Параметр отбора: модель выбирает следующий токен из наиболее вероятных вариантов с суммарной вероятностью p.

Связанные термины: Температура

TPM

Tokens per minute — допустимое число токенов в минуту; вторая составляющая rate limit.

Связанные термины: Rate limit, RPM