本地硬件上限本地设备无法持续承载能力更强、上下文更长的模型。
模型能力继续提高时,显存容量、内存带宽和功耗不会同步增长。用户越需要更强的模型,本地硬件上限就越早出现。
目标路径与验证边界
本地硬件上限模型能力继续提高时,显存容量、内存带宽和功耗不会同步增长。用户越需要更强的模型,本地硬件上限就越早出现。
TOKEN 供应方可见Prompt、历史对话和相关资料到达服务端后,必须成为模型能够读取和计算的状态。HTTPS 保护传输过程,不能阻止推理执行方读取正在计算的内容。
TEXT → NUMERIC STATETokenizer 把文本转成 Token ID(词元编号),模型再映射出 embedding 和逐层更新的 hidden state。这是表示转换,不是哈希或加密;数字仍然承载输入信息。
精确推理 · 非单点状态Fusion Compute 不是把数据换一种编码再交给同一个服务方,而是要重新安排状态由谁持有、计算在哪里发生、完整结果在哪里重建。
HISTORY · CURRENT STATEKV Cache 是历史 Token 的 key/value 记忆;hidden state 是当前 Token 正在向下一层传递的计算状态。两者不必每一步都恢复为一份集中状态,这给了分片执行一个结构入口。
OWNERSHIP → TOPOLOGY这里的数据主权首先意味着:由用户决定谁参与计算,以及每个参与方可以持有什么状态。单个外部参与方只获得自己的 shard;跨供应商仍是目标,不是当前证据。
LOCAL → REDUCESCATTER → SHARDReduceScatter 负责归约局部贡献,并把每段结果发给负责该段的节点。真正的后继算子随后继续读取 shard,而不是先在某个供应商侧拼回完整 Tensor。
用户定义重建边界具体汇合什么状态、在哪里汇合、采用什么协议,仍是后续工程问题。中途任何一次隐藏 AllGather 或完整状态恢复,都会让前面的分片失去意义;用户侧汇合与解码当前尚未验证。
用户先定义参与方和持有规则,再把计算状态分配给外部节点。
目标拓扑 · 参与方 A不独自持有完整执行状态
目标拓扑 · 参与方 B不独自持有完整执行状态
分布式拓扑归约局部贡献,继续传递输出 shard这张图表达目标架构,不代表当前部署拓扑。跨供应商隔离、用户侧 汇合与密码学保护仍待验证。
2× L4 · 250/250分片状态经过 Attention、SwiGLU MLP(门控非线性)和 residual add(把结果加回当前状态),随后被下一层真实 Q/K/V 投影读取;250/250 个受审计 step 闭合。
机制证据 ≠ 隐私产品结论只到这里:在已验证边界内,完整状态并非单点执行的必要条件。端到端输入、KV Cache 全生命周期、连续多 Layer、跨供应商、用户侧解码、Secret Sharing、TEE、MPC、恶意 worker 和节点合谋都尚未证明。
受审计区间内没有隐藏 AllGather;边界后的显式恢复不属于当前闭合结论。
深度 · 拓扑 · 信任 · 所有权这三个问题要分别验证,不能互相替代。用户侧重建、加密、隔离执行、可撤销授权、状态迁移和审计,则是其后的产品化工作。
模型能力来自外部,参与权和重建权留给用户。
用户选择谁参与计算、何时撤销授权、状态迁移到哪里。分片执行先提供 结构基础,加密、隔离执行和审计随后逐层叠加。