一款由Mistral AI和NVIDIA联合训练的高性能指令型大语言模型
更新时间:2024-07-21 15:34:26
Mistral-Nemo-Instruct-2407是一个基于Mistral-Nemo-Base-2407模型进行指令微调的大型语言模型。它由Mistral AI和NVIDIA联合训练,在性能上显著超越了同等规模或更小的现有模型。该模型采用Transformer架构,具有40层、5,120维度、32个注意力头和8个KV头等特性。它支持128k的上下文窗口,这意味着它可以处理更长的输入文本。此外,该模型在多语言和代码数据上进行了大比例的训练,使其在多语言处理和代码生成方面表现出色。
Mistral-Nemo-Instruct-2407的使用方法非常灵活,支持多种框架。你可以使用Mistral公司开发的mistral_inference库,这是推荐的使用方式。首先安装库,然后下载模型文件。之后,你可以使用命令行工具mistral-chat进行交互式对话,或者在Python代码中导入相关类来生成文本。另外,你也可以使用流行的Hugging Face transformers库来使用这个模型。只需要通过pipeline函数加载模型,然后传入对话消息即可生成回复。值得注意的是,与之前的Mistral模型相比,Mistral Nemo需要较小的温度参数,建议使用0.3左右的温度值来获得最佳效果。
暂无具体价格信息,模型以Apache 2许可证发布,可能免费用于研究目的
Mistral AI
暂无具体邮箱信息
twitter: @MistralAI