StingyChat 新一代 AI 对话平台
省流:做了一个以(也许是)最极限的方式省 Token 的聊天站(?)
StingyChat 为您带来了在网页端便能畅享高质量 Skills 的同时,降低成本的机会,并同步接入了 CP-OAuth 认证,便于您定制个性化的智能体验。
本项目使用了 GPT-5.6 Sol 辅助开发,保证本人对于本项目的贡献不少于 Codex 。
实机截图(图为作者使用 Deepseek API 进行对话):
仅供参考,实际作用以体验为准。
前言
不保证所有功能都会起到有效的正向优化,实际使用过程请警惕提示词污染、上下文遗忘等问题。
Agent 、 应用广场等功能正在开发中,可通过洛谷私信联系本人申请体验测试功能。(仅限已通过 CP OAuth 认证的用户使用。)
注意:由于智谱官方对于 GLM 系列免费模型的并发数的严格限制,使用公用池的 Key 将会面临严重的 429 报错、排队等问题,因此作者强烈建议用户自行注册 Bigmodel 账号,使用私有 API 体验功能。
推荐使用:
- 智谱 GLM Flash-X 系列模型,响应速度快。
- GLM-4.7/4.5-Flash ,完全免费,但存在并发数限制。
- GLM-5.2/5.3 ,智谱旗舰模型,成本低,且平台赠送大量免费额度。
- Deepseek-V4-Flash ,响应速度快,智能程度高,成本低。
不推荐 Deepseek-Pro 或其它更加先进的模型,原因在于速度较慢影响体验,且成本较高。
功能说明
应用内置了一个完全免费的 GLM-4.7-Flash 作为压缩上下文、优化提示词、增强语义命中率的工具。
此外,网页还提供了实时编译 Katex 和 Markdown 的渲染器。
应用提供的具体节省 Token 的策略如下所示:
- 规则提示词压缩。
- 本地启发式优化,移除语气词、客套话,指令去重。
- 上下文选择与自动压缩(调用免费的 GLM-4.7Flash )。
- JIT 资料检索知识库,只把最相关的几个片段注入上下文,而不是整篇文档。
- 同会话语义缓存。
- 厂商缓存映射。
- 模型路由, 用 GLM 给任务定级,简单任务切到更便宜的轻量模型。
- 惜字如金 System Prompt 人设。
- 流式输出和逐字渲染,让模型的回答看上去更加流畅即时。
- 充分利用多个免费大模型辅助推理,提高回答精确度,兼顾成本与效率。
- 知识库持久化,通过用户的对话收集高质量语料,在可用时直接反馈给用户。
- 其他优化。
注意事项
网页后端会收集用户的聊天数据用于优化算法、丰富知识库,我们保证不会将任何数据用于商业用途或非法行为。
本应用同时开发了移动端的响应式布局,但作者的主要开发精力都集中在电脑端的开发,若移动端出现 BUG 望及时反馈。
本开源项目遵循 GPL V3.0 开源协议 ,如果对您有帮助的话,还望您给出一个宝贵的 Star !
欢迎各位大佬提交 PR !
即刻体验!