GLM 5.3 Fast主推
quark/glm-5.3-fastGLM 5.3 的低延迟版本,模型能力与上下文规格一致,适用于对生成速度敏感的编程与 Agent 任务。
上下文1M
最大输出128K
输入类型
输出类型
价目
输入¥12/百万 tokens
输出¥42/百万 tokens
缓存命中¥3/百万 tokens
单价为人民币/百万 tokens;牌价变动同步生效。
规格
厂商Zhipu
定位极速版
能力深度推理代码特化
接口协议OpenAI Chat Completions 兼容
接入示例
from openai import OpenAI client = OpenAI( base_url="https://<node>.quark.ink/v1", # <node> 在控制台查看 api_key="qk_****", ) resp = client.chat.completions.create( model="quark/glm-5.3-fast", messages=[{"role": "user", "content": "你好,Quark"}], stream=True, )
替换 model 字段即可切换任意模型,其余代码零改动。