星火 X2.5-4B/1.7B 开源:端侧首个百万上下文
科大讯飞全资子公司词元星火在 9 月 1 日开源了星火 X2.5-4B 和 1.7B 两款端侧通用模型。最扎眼的一点:它是端侧模型里首个原生支持最长 100 万 Token 上下文的。把百万级信息处理能力塞进了本地设备,用的是混合注意力架构,并围绕智能体、代码、数学和指令遵循做了优化。
过去端侧模型处理长内容,得把文档切成几段分别喂,容易忘前情、漏信息。百万上下文解决的不是「能塞更多字」,而是「基于完整信息连续理解」——长上下文管「看不看全」,Agent 和工具调用管「看完能不能动手」。
对一个人公司,这个组合拳很对路:
- 「把整本手册读进去再回答」变成本地能做的事。 售后规则、产品文档、合同范本,一次性灌进去,模型能跨章节关联判断。不用把敏感文档发给云端 API。
- 部署门槛低。 支持英伟达、华为、海光、后摩等硬件,兼容 vLLM、SGLang、llama.cpp,Ollama、LM Studio 一键部署,还能用 LLaMA-Factory 增量训练。多硬件多框架,适配成本被压下来。
- 国产算力全流程训练。 约 20 万亿 Token 预训练,自主可控这条线对国内合规场景很重要。
几个要泼的冷水:
- 4B/1.7B 的能力天花板摆在那,百万上下文是「能装下」,不等于「装下后都能用对」。长程推理、复杂代码还是要看更大模型。
- 基准是官方给出,具体的「长文档 Agent」表现需要你自己拿业务数据测。
- 1.7B 更适合对话和轻量任务,真要干代码和 Agent 活,优先 4B。
我的建议:如果你手上有「长文档 + 反复问答 + 数据不能出网」的场景(合同、手册、内部知识库),星火 X2.5 是端侧里少有的、上下文够长到能一次看全的方案。先本地 Ollama 跑通一个「读完整手册再答」的 demo,比追参数更有价值。
原文出处 · 事实以此为准
中国日报网