术语表
AI 和 MyTokenGate 文档中的关键术语和概念。
AI 模型术语
LLM(大语言模型)
一种在海量文本数据上训练的 AI 模型,能够理解和生成类似人类的文本。例如 GPT-5.6、Claude 5 和 Gemini 3。
Token(词元)
LLM 文本处理的基本单位。大约:
- 1 token ≈ 4 个英文字符
- 1 token ≈ 0.75 个单词
- Token 数量因语言而异
上下文窗口
模型在单次请求中可以处理的最大文本量(以 token 计)。更大的窗口允许更长的对话和文档。
Temperature(温度)
控制输出随机性的参数(0-2):
- 0:确定性、一致的输出
- 0.7:平衡的创造性
- 1.5+:高随机性、创造性输出
Embeddings(嵌入)
捕获语义含义的文本向量表示。用于相似性搜索、聚类和检索。
推理模型(Reasoning Model)
在回答前会先进行内部推理(“思考”)的模型,如 GPT-5 系、Claude 与 Gemini 的思考模式。推理更慢、更贵,但在复杂问题上更准确。
推理努力度(Reasoning Effort)
控制推理深度的参数。OpenAI 用 reasoning_effort(minimal/low/medium/high 等),努力度越高、思考越多、延迟与成本也越高。
思考预算(Thinking Budget)
另一种控制推理量的方式,以 token 上限表示。Anthropic 用 budget_tokens,Gemini 用 thinkingBudget(0 关闭、-1 动态)。
reasoning_content
OpenAI 兼容接口中承载模型思考过程的字段(GLM、DeepSeek 等)。与最终回答的 content 分开返回,多轮工具调用时需原样保留。
多模态(Multimodal)
模型同时处理多种输入/输出形态的能力,如文本加图像。视觉语言模型(VLM)可理解图片内容。
API 术语
Chat Completion(聊天补全)
用于对话式 AI 交互的 API 端点。发送消息列表并接收模型生成的响应。
Streaming(流式传输)
一种实时逐段接收响应的方法,而不是等待完整响应。
Function Calling(函数调用)
允许模型在响应生成过程中调用外部函数/工具的功能。
Rate Limiting(限流)
在时间周期内限制 API 请求数量,以防止滥用并确保公平使用。
提示缓存(Prompt Caching)
复用请求间相同的长前缀(系统提示、长文档、工具定义),降低费用与首字延迟。命中的缓存 Token 按更低的缓存读取价计费。
结构化输出(Structured Output / JSON Schema)
让模型严格按给定 JSON Schema 输出的能力。通过 response_format 的 json_schema 形式声明字段与类型,比 json_object 约束更强。
工具选择(Tool Choice)
控制模型是否及如何调用工具的参数:auto(自行决定)、none(禁用)、required/any(强制调用),或指定某个函数。
并行工具调用(Parallel Tool Calls)
模型在一次响应中请求多个工具的能力,默认开启。可用 parallel_tool_calls=false(OpenAI)或 disable_parallel_tool_use=true(Anthropic)关闭。
首字延迟(TTFT,Time to First Token)
从发出请求到收到第一个输出 token 的时间。流式输出与提示缓存都能改善该指标。
MyTokenGate 术语
API Key(API 密钥)
用于验证 API 请求的唯一标识符。请保密,切勿公开分享。
Base URL(基础 URL)
API 端点地址:https://gateway.mytokengate.com/v1
Model Router(模型路由器)
MyTokenGate 的智能路由系统,将请求导向适当的 AI 提供商。
Billing Meter(计费计量)
实时跟踪 token 使用量,用于成本计算和发票生成。
故障转移(Fallback)
同一模型配置多家供应商时,主供应商不可用会自动切换到次级供应商,保障可用性。
协议术语
OpenAI 协议
最初由 OpenAI 定义的 API 格式,现已成为行业标准。许多 AI 服务使用它来实现兼容性。
Anthropic 协议
Claude 的原生 API 格式(Messages API)。支持工具使用和扩展思考等高级功能。
MCP(模型上下文协议)
Model Context Protocol,一种开放标准,让 AI 客户端以统一方式连接外部工具与数据源。它由客户端(如 Claude Code)实现,与模型 API 本身相互独立。