本地硬件上限本地设备跑不动真正想用的模型,用户自然会转向云端。
笔记本可以运行小模型,但模型规模、上下文长度和生成速度很快会碰到硬件上限。
给第一次听说这个项目的人
快速版沿着一条线走:先说明为什么要做,再交代怎么做、做到哪里、还缺什么。
从用户困境读到实验边界
本地硬件上限笔记本可以运行小模型,但模型规模、上下文长度和生成速度很快会碰到硬件上限。
云端执行可见Prompt、历史对话和相关资料必须变成后端能够读取和计算的内容,否则模型无法完成推理。
传输 ≠ 执行请求到达推理服务以后,服务端通常仍能看到可计算的明文状态。问题从网络传输转移到了执行环境。
精确推理 · 非单点状态Fusion Compute 把这件事收窄成一个可以被实验推翻的系统问题,而不是先承诺已经实现隐私推理。
DECODE · KV CACHE历史主要留在各层 KV Cache,也就是供当前 Token 查询的 key/value 记忆;逐层向前流动的是当前 Token 的状态。
Sₜ → A · B完整状态在逻辑上仍然存在;实验要检查的是,在声明的执行区间里,它能否始终由这些片段共同表示。
LOCAL → REDUCESCATTER → SHARDReduceScatter 在这里负责相加局部贡献,并只把每段结果发给对应节点,不先交给中心节点拼成完整 Tensor。
NO HIDDEN ALLGATHER如果中途隐藏地调用 AllGather,完整状态就会重新出现。只有真实后继算子直接读取 shard,这段计算才算闭合。
L4 · 同一 Pod只用自己的片段计算局部贡献 A
L4 · 同一 Pod只用自己的片段计算局部贡献 B
ReduceScatter相加两侧贡献,把输出 shard 交给对应节点下一层真实 Q/K/V 消费完成后:显式 AllGather,恢复后续未改动 Layer 所需布局。
2× L4 · 250/250分片状态经过 Attention、SwiGLU MLP(门控非线性)和 residual add(把结果加回当前状态),随后被下一层真实 Q/K/V 投影读取;250/250 个受审计 step 闭合。
机制证据 ≠ 隐私产品结论只到这里:在已验证边界内,完整状态并非单点执行的必要条件。下一层 Q/K/V 后仍会显式恢复兼容布局;连续多 Layer、Secret Sharing、TEE、MPC、恶意 worker、节点合谋和跨云生产都尚未证明。
深度 · 拓扑 · 信任边界分别验证:状态片段能连续经过多少算子和 Layer;同一套片段归属规则能扩到多少节点、适应哪些通信拓扑;这套结构能否跨 Pod、数据中心和供应商运行。
我们最终想补上的,不是另一个模型 API。
目标是让模型能力来自外部,同时由用户选择谁参与计算、何时撤销授权、 状态迁移到哪里;加密、隔离执行和审计需要在后续逐层叠加。