本地硬件上限模型越大、上下文越长,显存和内存带宽越先卡住。
本地设备可以运行小模型;当用户需要更强的模型、更长的上下文或更快的生成速度,内存容量、带宽和功耗很快会成为上限。
从用户困境读到实验边界
本地硬件上限本地设备可以运行小模型;当用户需要更强的模型、更长的上下文或更快的生成速度,内存容量、带宽和功耗很快会成为上限。
云端执行可见Prompt、历史对话和相关资料会进入执行环境,模型才能读取它们并完成推理。
文本 → 数值状态Tokenizer 先把文本转成 Token ID(词元编号),模型再把它映射为 embedding 和逐层更新的 hidden state。这些数值仍然承载输入信息,既不是哈希,也不是加密;HTTPS 只保护它们在传输途中。
精确推理 · 非单点状态我们先只验证一件事:状态被拆开以后,模型还能不能精确地继续算下去。这不是对完整隐私推理的提前承诺。
历史留存 · 当前状态流动各层 KV Cache 留住供当前 Token 查询的 key/value 历史;逐层流动的是当前 Token 的 hidden state。这给了我们拆分状态的入口。当前实验从受审计边界内的分片状态开始,不等于从原始文本到输出的端到端隐私。
状态 → 互补 SHARD我们现在只证明了同一 Pod、两张 L4、一个完整 decode Layer。KV Cache 全生命周期、跨供应商和端到端入口,都还没有被这次实验覆盖。
LOCAL → REDUCESCATTER → SHARDReduceScatter 负责归约各节点的局部贡献,并分发对应输出 shard。下一层真实 Q/K/V 投影接着读取这些 shard,不先拼回完整 Tensor。
NO HIDDEN ALLGATHER审计要排除两件事:隐藏的 AllGather,以及任何完整状态重建。否则这段分片计算并没有闭合。
这是数值表示,不是哈希或加密。当前实验的受审计边界从分片状态开始。
L4 · 同一 Pod只用自己的片段计算局部贡献 A
L4 · 同一 Pod只用自己的片段计算局部贡献 B
ReduceScatter相加两侧贡献,把输出 shard 交给对应节点下一层真实 Q/K/V 消费完成后:显式 AllGather,恢复后续未改动 Layer 所需布局。
2× L4 · 250/250分片状态经过 Attention、SwiGLU MLP(门控非线性)和 residual add(把结果加回当前状态),随后被下一层真实 Q/K/V 投影读取;250/250 个受审计 step 闭合。
机制证据 ≠ 隐私产品结论只到这里:在已验证边界内,完整状态并非单点执行的必要条件。下一层 Q/K/V 后仍会显式恢复兼容布局;连续多 Layer、Secret Sharing、TEE、MPC、恶意 worker、节点合谋和跨云生产都尚未证明。
深度 · 拓扑 · 信任 · 输出还要分别验证:shard 能连续经过多少算子和 Layer;归属规则能扩到多少节点和哪些拓扑;这套结构能否跨 Pod、数据中心和供应商运行。分片结果怎样在用户可控的一侧汇合、解码,也没有答案。
我们最终想补上的,不是另一个模型 API。
目标是让模型能力来自外部,同时由用户选择谁参与计算、何时撤销授权、 状态迁移到哪里;加密、隔离执行和审计需要在后续逐层叠加。