项目名称:MoonshotAI/Kimi-K3
Star数:7871
技术栈 / 语言:大语言模型、多模态AI
【项目深度介绍】
这是全球首个开源的3T级参数规模的原生多模态智能体模型,是目前月之暗面推出的能力最强的开源大模型,总参数量达2.8T,激活参数量104B,支持百万token上下文窗口,原生集成视觉理解能力。

该模型采用独创的Kimi Delta注意力机制和注意力残差架构,大幅提升了模型的推理效率和长序列处理能力,解决了现有开源大模型在长周期复杂任务处理、多模态理解、长上下文支持等方面的能力短板,为前沿智能研究、复杂工程开发、知识工作自动化等场景提供了开源可用的基座能力,支持研究人员和开发者在此基础上进行二次创新和部署落地。
【核心功能与亮点】

全新架构设计:基于Kimi Delta注意力(KDA)和注意力残差(AttnRes)构建,采用Stable LatentMoE稀疏架构,896个专家中仅激活16个,整体缩放效率相比前代Kimi K2提升约2.5 倍,兼顾性能与推理成本。
长周期代码开发能力:可在极低人工监督下完成长时间的工程开发任务,支持大型代码仓库导航、终端工具编排,覆盖GPU内核优化、编译器开发、视觉闭环游戏开发、CAD设计乃至芯片设计等复杂工程场景。
智能体知识工作能力:原生多模态架构支撑端到端知识工作自动化,可生成包含交互式可视化、组件和仪表板的深度研究内容,支持动效设计和视频编辑等创意工作。
原生多模态与超长上下文:同一模型原生支持文本、图像、视频理解,上下文窗口达1048576token,可一次性处理整本书籍、大型代码仓库、长视频等超大规模输入。
开放权重授权:在Kimi K3许可协议下开放完整模型权重,支持研究、部署和二次创新,让前沿智能能力可被产业界和学术界自由使用。
原生量化支持:从SFT阶段就采用量化感知训练,权重采用MXFP4量化、激活采用MXFP8量化,兼容主流硬件部署需求。

️ 快速开始
你可以通过官方API直接调用Kimi K3,也可以选择支持的推理引擎进行本地部署。以下是API调用的基础示例:
import openai
def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
messages = [
{
"role": "user",
"content": "Tell me three random numbers."
},
{
"role": "assistant",
"reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
"content": "473, 921, 235"
},
{
"role": "user",
"content": "What are the other two numbers you have in mind?"
}
]
response = client.chat.completions.create(
model=model_name,
messages=messages,
stream=False,
max_tokens=4096,
reasoning_effort="max",
)
# 模型会返回之前推理过程中提到的215和222
print(f"response: {response.choices[0].message.reasoning}")
调用时需注意,多轮对话和工具调用场景下,需要将API返回的完整assistant消息(包括reasoning_content和tool_calls字段,而不仅是content字段)原样传入下一轮的messages参数中,以获得最佳效果。

使用场景
复杂软件工程开发:可作为智能编程助手,支撑GPU内核开发、编译器优化、芯片设计等前沿工程任务,自动处理大型代码仓库理解、多工具协同调度等复杂流程。
深度学术研究辅助:支持长文档理解、数据可视化生成、研究报告撰写,可自动完成文献综述、实验结果分析、交互式仪表板制作等科研工作。
多模态内容生产:可处理图像、视频输入,支撑视频剪辑、动效设计、富媒体内容创作等创意工作,实现端到端的多模态内容生成。
企业级智能体开发:百万token上下文和强大的工具调用能力,适合开发办公自动化、财务分析、法律检索等企业级智能体应用,处理复杂的业务流程。
前沿AI研究:作为开源的3T级多模态Agent基座,支持学术界开展长上下文理解、多模态推理、智能体架构等方向的前沿研究。
【下载地址】⬇️