英文

ChatGLM2-6B

? Github Repo • ? Twitter • ? [GLM@ACL 22] [GitHub] • ? [GLM-130B@ICLR 23] [GitHub]

? 加入我们的 Slack WeChat

介绍

ChatGLM 2-6B 是开源中英双语对话模型 ChatGLM-6B 的第二代版本,在保留了初代模型对话流畅、部署门槛较低等众多优秀特性的基础之上,ChatGLM 2-6B 引入了如下新特性:

  • 更强大的性能 :基于 ChatGLM 初代模型的开发经验,我们全面升级了 ChatGLM2-6B 的基座模型。ChatGLM2-6B 使用了 GLM 的混合目标函数,经过了 1.4T 中英标识符的预训练与人类偏好对齐训练,评测结果显示,相比于初代模型,ChatGLM2-6B 在 MMLU(+23%)、CEval(+33%)、GSM8K(+571%)、BBH(+60%)等数据集上的性能取得了大幅度的提升,在同尺寸开源模型中具有较强的竞争力。
  • 更长的上下文 :基于 FlashAttention 技术,我们将基座模型的上下文长度(Context Length)由 ChatGLM-6B 的2K扩展到了32K,并在对话阶段使用8K的上下文长度训练,允许更多轮次的对话。但当前版本的 ChatGLM2-6B 对单轮超长文档的理解能力有限,我们会在后续迭代升级中着重进行优化。
  • 更高效的推理 :基于 Multi-Query Attention 技术,ChatGLM2-6B 有更高效的推理速度和更低的显存占用:在官方的模型实现下,推理速度相比初代提升了42%,INT4量化下,6G显存支持的对话长度由1K提升到了8K。
  • 更开放的协议 :ChatGLM2-6B 权重对学术研究完全开放,在填写 问卷 进行登记后亦允许免费商业使用。
  • ChatGLM 2-6B是开源中英双语对话模型 ChatGLM-6B 的第二代版本。它保留了第一代模型的流畅对话流程和低部署门槛,并引入了以下新功能:

  • 更强大的性能:基于第一代ChatGLM模型的开发经验,我们完全升级了ChatGLM2-6B的基座模型。ChatGLM2-6B使用了 GLM 的混合目标函数,并进行了1.4T中英双语标识符的预训练和与人类偏好对齐的训练。评估结果显示,与第一代模型相比,ChatGLM2-6B在MMLU(+23%)、CEval(+33%)、GSM8K(+571%)、BBH(+60%)等数据集上的性能有了显著提升,在相同大小的模型中表现出强大的竞争力。
  • 更长的上下文:基于 FlashAttention 技术,我们将基座模型的上下文长度从ChatGLM-6B的2K扩展到32K,并在对话对齐阶段使用8K的上下文长度进行训练,允许进行更多轮次的对话。然而,当前版本的ChatGLM2-6B对于单轮超长文档的理解能力有限,我们将在未来的迭代中重点进行优化。
  • 更高效的推理:基于 Multi-Query Attention 技术,ChatGLM2-6B具有更高效的推理速度和更低的GPU内存使用率:在官方实现下,与第一代相比,推理速度提高了42%;在INT4量化下,6G显存支持的对话长度从1K提高到了8K。
  • 更加开放的许可协议:ChatGLM2-6B的权重在学术研究方面是完全开放的,并且在完成 questionnaire 后,也允许免费商业使用。
  • 软件依赖

    pip install protobuf transformers==4.30.2 cpm_kernels torch>=2.0 gradio mdtex2html sentencepiece accelerate
    

    代码调用

    可以通过如下代码调用ChatGLM-6B模型来生成对话:

    >>> from transformers import AutoTokenizer, AutoModel
    >>> tokenizer = AutoTokenizer.from_pretrained("THUDM/chatglm2-6b", trust_remote_code=True)
    >>> model = AutoModel.from_pretrained("THUDM/chatglm2-6b", trust_remote_code=True).half().cuda()
    >>> model = model.eval()
    >>> response, history = model.chat(tokenizer, "你好", history=[])
    >>> print(response)
    你好?!我是人工智能助手 ChatGLM-6B,很高兴见到你,欢迎问我任何问题。
    >>> response, history = model.chat(tokenizer, "晚上睡不着应该怎么办", history=history)
    >>> print(response)
    晚上睡不着可能会让你感到焦虑或不舒服,但以下是一些可以帮助你入睡的方法:
    
    1. 制定规律的睡眠时间表:保持规律的睡眠时间表可以帮助你建立健康的睡眠习惯,使你更容易入睡。尽量在每天的相同时间上床,并在同一时间起床。
    2. 创造一个舒适的睡眠环境:确保睡眠环境舒适,安静,黑暗且温度适宜。可以使用舒适的床上用品,并保持房间通风。
    3. 放松身心:在睡前做些放松的活动,例如泡个热水澡,听些轻柔的音乐,阅读一些有趣的书籍等,有助于缓解紧张和焦虑,使你更容易入睡。
    4. 避免饮用含有咖啡因的饮料:咖啡因是一种刺激性物质,会影响你的睡眠质量。尽量避免在睡前饮用含有咖啡因的饮料,例如咖啡,茶和可乐。
    5. 避免在床上做与睡眠无关的事情:在床上做些与睡眠无关的事情,例如看电影,玩游戏或工作等,可能会干扰你的睡眠。
    6. 尝试呼吸技巧:深呼吸是一种放松技巧,可以帮助你缓解紧张和焦虑,使你更容易入睡。试着慢慢吸气,保持几秒钟,然后缓慢呼气。
    
    如果这些方法无法帮助你入睡,你可以考虑咨询医生或睡眠专家,寻求进一步的建议。
    

    关于更多的使用说明,包括如何运行命令行和网页版本的DEMO,以及使用模型量化以节省显存,请参考我们的 Github Repo

    For more instructions, including how to run CLI and web demos, and model quantization, please refer to our Github Repo .

    Change Log

    • v1.0

    协议

    本仓库的代码依照Apache-2.0协议开源,ChatGLM2-6B模型的权重的使用则需要遵循 Model License 。

    引用

    如果你觉得我们的工作有帮助的话,请考虑引用下列论文,ChatGLM2-6B的论文会在近期公布,敬请期待~

    @article{zeng2022glm,
      title={Glm-130b: An open bilingual pre-trained model},
      author={Zeng, Aohan and Liu, Xiao and Du, Zhengxiao and Wang, Zihan and Lai, Hanyu and Ding, Ming and Yang, Zhuoyi and Xu, Yifan and Zheng, Wendi and Xia, Xiao and others},
      journal={arXiv preprint arXiv:2210.02414},
      year={2022}
    }
    
    @inproceedings{du2022glm,
      title={GLM: General Language Model Pretraining with Autoregressive Blank Infilling},
      author={Du, Zhengxiao and Qian, Yujie and Liu, Xiao and Ding, Ming and Qiu, Jiezhong and Yang, Zhilin and Tang, Jie},
      booktitle={Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)},
      pages={320--335},
      year={2022}
    }