用户拥有数据主权的
推理架构

目标路径与验证边界

从数据进入模型,到结果回到用户。

  1. 01

    用户想用的模型,往往已经超出手机或笔记本能稳定运行的范围。

    模型参数增加,权重会占用更多内存。上下文拉长后,模型还要为更多历史 Token 保留推理状态。权重和状态可能一起挤满设备内存;即使装得下,内存带宽和持续功耗预算也可能把生成速度压到难以接受。

  2. 02
    云端执行时的数据可见性推理执行方可读

    普通明文云推理补足了算力,也让推理执行方能够读取完整请求。

    Prompt、历史对话和相关资料到达服务端后,必须成为模型能够读取和计算的状态。HTTPS 保护传输过程,不能阻止推理执行方读取正在计算的内容。

  3. 03
    待验证的系统问题精确推理 · 非单点状态

    能否借用外部算力完成精确推理,却不让单个节点持有完整执行状态?

    Fusion Compute 检查状态由哪些节点持有,以及后继算子能否直接读取 shard 继续计算。把同一份状态换一种编码后交给单个服务方,并不会改变它能否读取完整状态。

  4. 04
    文本到数值状态TEXT → NUMERIC STATE

    在目标架构中,文本先在用户可控的一侧变成模型能够计算的数值状态。

    Tokenizer 把文本转成 Token ID(词元编号),模型再映射出 embedding 和逐层更新的 hidden state。这是表示转换,不是哈希或加密;数字仍然承载输入信息。

  5. 05
    Decode 中的两类状态HISTORY · CURRENT STATE

    Decode 把历史留在各层 KV Cache,当前 Token 的状态逐层向前流动。

    KV Cache 是历史 Token 的 key/value 记忆;hidden state 是当前 Token 正在向下一层传递的计算状态。实验要检查两类状态能否保持分片,并被后继算子直接读取,而不在受审计区间内恢复完整状态。

  6. 06
    从拓扑到状态分片TOPOLOGY → SHARDS

    先设计后续计算经过哪些节点,再把当前 Token 的计算状态切成 shard,分给不同参与方。

    拓扑规则规定哪些节点参与、每个节点持有什么。参与方可以来自不同计算供应商,但跨供应商执行仍是目标;当前实验只覆盖同一 Pod 的两张 L4。

  7. 07
    分片状态继续向前LOCAL → REDUCESCATTER → SHARD

    节点只持有和传递局部状态,并用这些状态计算局部贡献;后继算子直接读取输出 shard。

    ReduceScatter 负责归约局部贡献,并把每段结果发给负责持有该输出 shard 的节点。审计检查受审计区间内是否出现完整 Tensor 重建;当前结果不能说明单个 shard 无法泄露输入信息。

  8. 08
    目标架构的本地起点与终点LOCAL → DISTRIBUTED → LOCAL

    目标路径让文本编码从用户本地开始,结果也回到本地解码。

    推理的起点和终点留在用户可控的一侧,外部节点只参与中间计算。当前实验尚未验证端到端本地编码、用户侧汇合或解码。

  9. 目标架构概念图:文本在本地编码,当前 Token 状态按预先设计的计算拓扑切成多个 shard,交由不同参与节点处理,结果返回本地汇合并解码;这条端到端路径尚未验证。
  10. 09
    已验证的执行边界2× L4 · 250/250

    Qwen2.5-1.5B 的分片状态已在同一 Pod 的两张 L4 上走完一个完整 decode Layer。

    分片状态经过 Attention、SwiGLU MLP(门控非线性)和两次 residual add(把结果加回当前状态),随后被下一层真实 Q/K/V 投影读取;250/250 个受审计 step 都满足上述条件。受审计区间内没有隐藏 AllGather。这只支持:在已验证边界内,完整状态并非单点执行的必要条件。验证边界之后显式执行兼容性 AllGather。

  11. 10
    还需独立验证的范围LAYER · RANK · DEPLOYMENT

    连续多 Layer、更多节点和跨 Pod 或供应商的部署都需要新的证据。

    端到端输入、KV Cache 全生命周期、用户侧重建、Secret Sharing、TEE、MPC、恶意 worker 和节点合谋也都尚未验证。当前结构证据不等于完整隐私产品。

继续阅读

探索纯私有化部署与纯云端算力之间的第三条计算路径

完整技术说明列出当前实验的算子路径、审计区间和证据尚未覆盖的部分。

继续阅读完整技术说明 →回到开头 ↑