2026年9月24日 • Kefuro 动态
📦 Kefuro-30B 开始用真实客服结果训练

查看计划

Kefuro 登场 不只是聊天

行业第一个电商客服模型

申请内测
KF.AI.0S1
GPT
GPT
通用聊天
✣ chat
RAG
RAG
检索机器人
✣ faq
KEFURO
KEFURO
用结果训练
✣ 30B✣ gate
按我们的用量,每月成本
GPT-5.4 API$50,000
Kefuro · 2×RTX PRO 6000$2,100
Kefuro 回复延迟0.2–0.5s

每月约 154 亿输入 + 7.7 亿输出 token

Clock Tool 1.1
—
—
Kefuro
Version 0.01
© 2026 Kefuro
San Jose 出品。服务全球卖家。

我们用结果训练,而不是用观点

不是聊天机器人

通用聊天模型被调教成讨好正在打字的人。客服要的是另一回事:答案正确、不越出店铺政策、用买家的语言回复,每一次都如此。

专精的模型

Kefuro 从几百万条真实客服对话以及后续结果里学习:解决了、转人工了、退款了,还是被打了差评。好的结果教它怎么做,坏的结果成为它的反面教材。

两道闸

每条回复在写之前、写之后都要过一个决策模型。答案如果在订单数据里找不到依据,或者违反了店铺政策,Kefuro 会转人工,而不是去猜。

成本约 1/24,回复约 0.3 秒。

成本:按我们的用量,自有部署估算对比 GPT-5.4 公开价。延迟:单张 RTX PRO 6000 实测,非推理模式,内部预览版。

一条回复是怎么产生的

  1. 01

    硬规则

    安全问题、法律威胁、要求找真人,直接转人工,不交给模型判断。

  2. 02

    Kefuro-Gate · 生成前

    校准过的决策模型先读工单:识别意图、选工具、判断要不要转人工、决定由哪一档来回答。

  3. 03

    Kefuro-30B 写回复

    回复模型依据订单数据和店铺知识库作答,用买家的语言。

  4. 04

    Kefuro-Gate · 生成后

    同一道闸检查草稿:有没有依据、是否合规、语气对不对。不合格就换更大的一档重答,还不行就转人工。

Kefuro 模型家族

训练中

Kefuro-30B

回复模型。300 亿参数的混合专家模型,每个 token 约激活 30 亿参数,基于 NVIDIA Nemotron 3.5 Lightning,用客服结果做后训练。

训练中

Kefuro-Gate

决策模型。一次前向计算就给出意图、是否转人工、选哪个工具、回复质量的校准概率。基于开源的 Laya 模型。

即将发布

Kefuro-Bench

面向电商客服的公开评测集:多语种工单、政策陷阱题、必须转人工的高危单,按结果打分,不看文风。

适用对象 独立站品牌 · 平台卖家 · 跨境卖家 · 全渠道零售

我们从电商起步,因为我们自己的客服数据来自电商。其他行业以后再做。

支持语言 English · Español · Français · Deutsch · Italiano · 日本語

申请内测

内测伙伴会最先拿到 Kefuro 的模型,参与评测,并决定我们下一步优先覆盖哪些行业。

early-access.form

更习惯发邮件? support@flatkey.ai

常见问题

Kefuro 是什么?

Kefuro 是一组只为电商客服打造的模型:一个回复模型、一个检查每条回复的决策模型,以及一个公开评测集。

为什么不直接用 GPT 或 Claude?

它们是很好的通用模型,但电商客服是一份很窄的工作,有自己特有的出错方式:编造物流日期、承诺店铺政策不允许的退款、用错语言。用真实结果训练的专精模型,这类错误更少,运行成本也低得多。

只做电商吗?

现阶段是的。我们自己的客服数据来自电商,所以 Kefuro 先在电商上训练和评测。电商做扎实之后,再扩展到其他行业。

模型跑在哪里?

跑在我们自己租用、自己运维的 GPU 上。客户对话不会经过任何第三方模型 API。

"成本约 1/24"具体指什么?

按我们现在的用量,同样的流量用 GPT-5.4 公开价每月约 $50,000,用两张自有部署的 RTX PRO 6000 每月约 $2,100。这是基于我们自己实测的估算,不代表其他业务也是这个数。

现在能用吗?

还不能。Kefuro-30B 和 Kefuro-Gate 正在训练。内测伙伴会最先拿到第一批模型,并参与评测。

会开源权重吗?

Kefuro-Bench 会公开。模型通过我们自己的评测后,计划在 Hugging Face 上发布权重,许可证随发布一起公布。