Kefuro-30B
回复模型。300 亿参数的混合专家模型,每个 token 约激活 30 亿参数,基于 NVIDIA Nemotron 3.5 Lightning,用客服结果做后训练。
Kefuro 登场 不只是聊天
每月约 154 亿输入 + 7.7 亿输出 token
不是聊天机器人
通用聊天模型被调教成讨好正在打字的人。客服要的是另一回事:答案正确、不越出店铺政策、用买家的语言回复,每一次都如此。
专精的模型
Kefuro 从几百万条真实客服对话以及后续结果里学习:解决了、转人工了、退款了,还是被打了差评。好的结果教它怎么做,坏的结果成为它的反面教材。
两道闸
每条回复在写之前、写之后都要过一个决策模型。答案如果在订单数据里找不到依据,或者违反了店铺政策,Kefuro 会转人工,而不是去猜。
成本:按我们的用量,自有部署估算对比 GPT-5.4 公开价。延迟:单张 RTX PRO 6000 实测,非推理模式,内部预览版。
安全问题、法律威胁、要求找真人,直接转人工,不交给模型判断。
校准过的决策模型先读工单:识别意图、选工具、判断要不要转人工、决定由哪一档来回答。
回复模型依据订单数据和店铺知识库作答,用买家的语言。
同一道闸检查草稿:有没有依据、是否合规、语气对不对。不合格就换更大的一档重答,还不行就转人工。
回复模型。300 亿参数的混合专家模型,每个 token 约激活 30 亿参数,基于 NVIDIA Nemotron 3.5 Lightning,用客服结果做后训练。
决策模型。一次前向计算就给出意图、是否转人工、选哪个工具、回复质量的校准概率。基于开源的 Laya 模型。
面向电商客服的公开评测集:多语种工单、政策陷阱题、必须转人工的高危单,按结果打分,不看文风。
适用对象 独立站品牌 · 平台卖家 · 跨境卖家 · 全渠道零售
我们从电商起步,因为我们自己的客服数据来自电商。其他行业以后再做。
支持语言 English · Español · Français · Deutsch · Italiano · 日本語
内测伙伴会最先拿到 Kefuro 的模型,参与评测,并决定我们下一步优先覆盖哪些行业。
更习惯发邮件? support@flatkey.ai
Kefuro 是一组只为电商客服打造的模型:一个回复模型、一个检查每条回复的决策模型,以及一个公开评测集。
它们是很好的通用模型,但电商客服是一份很窄的工作,有自己特有的出错方式:编造物流日期、承诺店铺政策不允许的退款、用错语言。用真实结果训练的专精模型,这类错误更少,运行成本也低得多。
现阶段是的。我们自己的客服数据来自电商,所以 Kefuro 先在电商上训练和评测。电商做扎实之后,再扩展到其他行业。
跑在我们自己租用、自己运维的 GPU 上。客户对话不会经过任何第三方模型 API。
按我们现在的用量,同样的流量用 GPT-5.4 公开价每月约 $50,000,用两张自有部署的 RTX PRO 6000 每月约 $2,100。这是基于我们自己实测的估算,不代表其他业务也是这个数。
还不能。Kefuro-30B 和 Kefuro-Gate 正在训练。内测伙伴会最先拿到第一批模型,并参与评测。
Kefuro-Bench 会公开。模型通过我们自己的评测后,计划在 Hugging Face 上发布权重,许可证随发布一起公布。