Logo

site iconManatee LazyCat

懒猫微服CEO,Linux, Emacs开源社区从业二十余载。
请复制 RSS 到你的阅读器,或快速订阅到 :

Inoreader Feedly Follow Feedbin Local Reader

Manatee LazyCat RSS 预览

GPT + Qwen 3.8 27B 协作工作流

2026-09-16 00:00:00

我还是太爱 Qwen 3.8 27B 了,虽然没有 GPT 那么全能,但是只要是明确的任务,详细说好了,真的是指哪打哪。

很多朋友会问为什么不用解码速度更快的 Qwen 3.8 Flash Next?因为我这两三周都在做 AI 模型移植的工作,我发现 Qwen 3.8 Flash Next 这个模型训练的还是不够严谨,上下文非常长的时候,会出现乱码的情况,只能靠 Pi Agent 温度配置来缓解,而 Qwen 3.8 27B 各种稳定呀。

我现在都用 GPT 做规划,让 27B 去执行,效率杠杠的。

用 Pi Agent 配 Qwen 3.8 27B 修复博客视频问题的过程:

Pi Agent 配 Qwen 3.8 27B 修复博客视频问题

动态 KV Cache 技术分享

2026-09-16 00:00:00

AI 模型动态 KV Cache 技术分享。这两天我一直在研究上下文和 KV Cache 的动态调节技术,终于被我搞出来了。

现在用户部署的时候,KV Cache 会根据用户输入的上下文动态调节显存占用的值,而不是像原来那样通过 --gpu-memory-utilization 固定的显存分配申请。

KV Cache 按照公式计算:

2 GiB + tokens × 87 KiB

再按 256 MiB 对齐。

改动以后,Qwen 3.8 27B 512K 和 900K 上下文的显存差距可以拉到 30GB 左右,用户可以用多余的 30GB 显存并行跑其他模型。

模型不同上下文的解码速度

2026-09-15 00:00:00

这几天在做精细化的 AI 模型移植,发现一个特别有趣的现象。

Qwen 3.8 Flash Next 的甜品区是 265K 的上下文,它的解码速度最快。

Qwen 3.8 27B 的甜品区,不是 265K,也不是 900K,反而是 512K 的时候,它的解码速度最快。

Qwen 3.8 27B 不同上下文长度的解码速度对比

这个测试结果是非常有意思的,分享给大家,赶快去把你的上下文调到最优的值吧😎

超大 PDF 的流畅缩放优化

2026-09-14 00:00:00

分享一下读书软件的深度优化技巧。

懒猫读书的后端是传输片段到前端去做实时渲染的。这样的好处就是不光传图片,前端可以直接用后端传输的原始数据进行文字标注和文字选中。

但是遇到很多超大的 PDF,传输 PDF 的原始数据就不现实了,因为会超级卡,甚至很多超大的 PDF 会把平板和手机的内存撑爆。

所以这种超大的 PDF 只能传缩略图,但是传缩略图又会导致放大的时候会有一定的模糊。

所以现在懒猫读书的方案是:

  • 可编辑的文档传原始数据。
  • 不可编辑的文档,像 PDF 扫描版传缩略图。
  • 遇到缩放的时候再临时传输 tile 做高清晰渲染层。

这样就可以兼顾流畅性、前端内存的控制,同时针对极限缩放提供无极的清晰度。

今天终于把这个花雕完了,大家可以看一下我们实时放大的效果,还是很不错的。

技术人创业需要补强的三个方面

2026-09-13 00:00:00

今天跟大家分享一下技术人创业需要补强的几个方面

  1. 大方向要对,方向不对,就是勤奋自我感动。大方向来源于读书、交流、晒太阳、散步、深度思考

  2. 大错不要犯,一般犯大错的原因就是自己在顺境中获取优势以后,自我膨胀。膨胀才会犯大错。避免犯大错的方法还是读书,多读历史书,看到古人作死的方式,就会时刻反省自己不要膨胀

  3. 做事要果断,在 AI 时代,最重要的是你的判断力,执行力不是瓶颈了。判断力培养的方式就是要果断做决定,果断犯小错,也比优柔寡断不做决定好,因为 AI 时代的执行力很强,你犯的小错可以通过快速迭代来解决