KV Cache
观察序列长度、缓存占用和生成延迟之间的关系。
PLANNED把抽象概念做成可以调参数、看反馈、形成直觉的小实验。
移动 Query 与三个 Key 的数值。实验会计算点积,再经过 softmax 得到注意力权重。
当前 Query 与 “love” 的点积最高,因此获得最多注意力。
观察序列长度、缓存占用和生成延迟之间的关系。
PLANNED调节 chunk、召回数量和阈值,比较答案证据。
PLANNED逐步查看 observe、plan、act、reflect 状态变化。
PLANNED