面向用户数据主权的
分片推理探索。

从用户困境读到实验边界

从问题出发。

  1. 01
    本地为何不够本地硬件上限

    模型越大、上下文越长,显存和内存带宽越先卡住。

    本地设备可以运行小模型;当用户需要更强的模型、更长的上下文或更快的生成速度,内存容量、带宽和功耗很快会成为上限。

  2. 02
    云端解决了一半云端执行可见

    转到云端后,算力够了;服务端通常也要持有可读取、可计算的请求状态。

    Prompt、历史对话和相关资料会进入执行环境,模型才能读取它们并完成推理。

  3. 03
    数值化不等于隐藏文本 → 数值状态

    文本变成数字后,并没有因此变得不可读。

    Tokenizer 先把文本转成 Token ID(词元编号),模型再把它映射为 embedding 和逐层更新的 hidden state。这些数值仍然承载输入信息,既不是哈希,也不是加密;HTTPS 只保护它们在传输途中。

  4. 04
    现在缺少的桥精确推理 · 非单点状态

    能否借用外部算力完成精确推理,却不让单个节点持有完整执行状态?

    我们先只验证一件事:状态被拆开以后,模型还能不能精确地继续算下去。这不是对完整隐私推理的提前承诺。

  5. 05
    Transformer 留下的入口历史留存 · 当前状态流动

    Decode 不会每次重算整段历史,当前 Token 的状态只需逐层往前走。

    各层 KV Cache 留住供当前 Token 查询的 key/value 历史;逐层流动的是当前 Token 的 hidden state。这给了我们拆分状态的入口。当前实验从受审计边界内的分片状态开始,不等于从原始文本到输出的端到端隐私。

  6. 06
    先规定谁持有什么状态 → 互补 SHARD

    先规定每段状态由谁持有,再按这个规则拆开;单个节点只拿到自己的 shard。

    我们现在只证明了同一 Pod、两张 L4、一个完整 decode Layer。KV Cache 全生命周期、跨供应商和端到端入口,都还没有被这次实验覆盖。

  7. 07
    每个节点怎么计算LOCAL → REDUCESCATTER → SHARD

    节点计算局部贡献,再把输出 shard 交给负责这段结果的节点。

    ReduceScatter 负责归约各节点的局部贡献,并分发对应输出 shard。下一层真实 Q/K/V 投影接着读取这些 shard,不先拼回完整 Tensor。

  8. 08
    真正困难的地方NO HIDDEN ALLGATHER

    切分、传递和归约之后,真实的下一算子还必须接着使用 shard。

    审计要排除两件事:隐藏的 AllGather,以及任何完整状态重建。否则这段分片计算并没有闭合。

  9. 05–08 · 把执行路径放在一张图里

    数值化只是进入模型;分片能否被下一算子接住,才是实验要查的事。

    文本如何进入模型计算文本 → Token ID → embedding / hidden state

    这是数值表示,不是哈希或加密。当前实验的受审计边界从分片状态开始。

    节点 AL4 · 同一 Pod
    历史KV Cache 片段 A当前 Tokenhidden shard A

    只用自己的片段计算局部贡献 A

    节点 BL4 · 同一 Pod
    历史KV Cache 片段 B当前 Tokenhidden shard B

    只用自己的片段计算局部贡献 B

    ReduceScatter相加两侧贡献,把输出 shard 交给对应节点
    节点 A 持有输出 shard A节点 B 持有输出 shard B
    真实后继算子下一层 Q/K/V 直接读取两侧 shard
    已验证区间没有隐藏 AllGather
    边界之后

    下一层真实 Q/K/V 消费完成后:显式 AllGather,恢复后续未改动 Layer 所需布局。

  10. 09
    目前已经做到哪里2× L4 · 250/250

    Qwen2.5-1.5B 的一个完整 decode Layer 已在同一 Pod 的两张 L4 上闭合。

    分片状态经过 Attention、SwiGLU MLP(门控非线性)和 residual add(把结果加回当前状态),随后被下一层真实 Q/K/V 投影读取;250/250 个受审计 step 闭合。

  11. 10
    不要越过证据机制证据 ≠ 隐私产品

    当前证据证明了执行结构,不提供完整隐私保证。

    结论只到这里:在已验证边界内,完整状态并非单点执行的必要条件。下一层 Q/K/V 后仍会显式恢复兼容布局;连续多 Layer、Secret Sharing、TEE、MPC、恶意 worker、节点合谋和跨云生产都尚未证明。

  12. 09–10 · 把事实和结论分开

    当前证据只覆盖这段执行边界。

    模型Qwen2.5-1.5B
    位置同一 Pod
    硬件2× NVIDIA L4
    执行深度1 个完整 decode Layer
    闭合边界下一层真实 Q/K/V
    审计结果250 / 250 decode steps
    这组证据支持在已经验证的执行边界内,完整状态并非单点执行的必要条件。
    证据尚未覆盖
    • 连续多个 Layer 不恢复完整状态
    • 三节点及更一般拓扑
    • 跨 Pod、数据中心或供应商
    • Secret Sharing、TEE 或 MPC
    • 恶意 worker 与节点合谋
  13. 11
    接下来要回答什么深度 · 拓扑 · 信任 · 输出

    下一步既要扩大分片执行边界,也要决定输出在哪里汇合。

    还要分别验证:shard 能连续经过多少算子和 Layer;归属规则能扩到多少节点和哪些拓扑;这套结构能否跨 Pod、数据中心和供应商运行。分片结果怎样在用户可控的一侧汇合、解码,也没有答案。

我们最终想补上的,不是另一个模型 API。

在本地小模型和明文云 API 之间,
建立第三条推理路径。

目标是让模型能力来自外部,同时由用户选择谁参与计算、何时撤销授权、 状态迁移到哪里;加密、隔离执行和审计需要在后续逐层叠加。

继续阅读完整技术说明 →回到开头 ↑