受控开放模型访问

Qwen 3.8 Flash Uncensored 120B私有 API 访问

申请 120B 级 Qwen 系 NVFP4 checkpoint 的受控访问,用于快速私有推理、多语言应用、Agent 和更具成本效率的专用部署。

120B-class checkpointNVFP4 checkpointPrivate APIOpenAI-compatible target

私有算力

注册后确认访问

该模型通过受控访问流程提供。注册并提交预计流量和部署需求后,LLMsRelay 将确认容量、商业条件、模型 ID 和上线时间。

120B-class checkpoint

NVFP4 checkpoint

Approximately 135 GB

Reference deployment: 2× DGX Spark

查看 checkpoint 来源
团队为何选择它

本组模型中显存与基础设施需求更低的选项,适合希望保留多语言和 Agent 能力的团队。

三款模型中基础设施效率最高;具体部署需确认容量及商业许可条件。
商业使用场景
低延迟私有助手
多语言支持与内容运营
Agent 原型和工具工作流
更小 GPU 占用的专用推理

私有访问流程

注册后确认访问

01
1

创建账户

注册 LLMsRelay 并打开开发者 dashboard。

02
2

描述工作负载

提交目标模型、预计 token 量、并发、地区和延迟要求。

03
3

确认容量

我们确认 GPU 可用性、许可限制、路由和商业条件。

04
4

完成集成

激活后使用为账户确认的模型 ID 和 API 配置。

集成目标

计划通过 LLMsRelay 提供 OpenAI 兼容请求流程。准确模型 ID 和端点可用性会在访问审核后提供。

可用性

该模型不是即时自助式公开目录项目。容量会为审核通过的账户预留或部署,并可能因地区和部署规模而异。

许可与可接受使用

访问受 checkpoint 许可、适用法律和 LLMsRelay 可接受使用控制约束。Uncensored 不代表无限制或匿名使用。

访问受 checkpoint 许可、适用法律和 LLMsRelay 可接受使用控制约束。Uncensored 不代表无限制或匿名使用。

模型访问常见问题

LLMsRelay 是否提供 Qwen 3.8 Flash Uncensored 120B?

通过受控访问流程提供。注册后开始容量和部署审核,目前不承诺即时公开模型 ID。

可以使用 OpenAI 兼容客户端吗?

这是计划中的集成方式。最终 base URL、模型 ID、限制和流式行为会针对已激活账户确认。

多久可以开通?

时间取决于模型、GPU 容量、地区、并发、许可审核和预计用量。工作负载审核后会确认时间。

Uncensored 是否意味着没有限制?

不是。Checkpoint 行为与平台规则是两件事,适用法律、滥用防护、许可和账户控制仍然有效。

比较私有模型选项

查看其他受控访问 checkpoint,并选择适合工作负载的容量配置。

将该模型接入您的产品

注册并描述工作负载,获取有容量保障的集成方案,无需自行猜测硬件和路由。

注册并申请访问