Lucent's Blog

Lucent's Blog

当时明月在 曾照彩云归


人生不相见,动如参与商。


Lucent

Lucent

125 篇文章

  1. 模型量化

    3 min read
    AI · 大模型

    模型量化(quantization)指的是用更少的bit表示模型参数,从而减少模型的大小,加速推理过程的技术。 模型量化是把模型的参数从FP32映射到nbit位的过程, 简单来说就是在定点数与浮点数等数据之间建立一种数据映射关系, 使得以较小的精度损失代价获得了较好的收益。 例如FP32-->INT8可以实现4倍的参数压缩,在压缩内存的同时可以实现更快速的计算,从而有效地提高模型的性能; 最极端的二值量化理论上甚至可以实现32倍的压缩,但是过度的压缩会导致模型的精度快速下降, 所以更多量化的时候需要做好精度和性能的权衡. 工业界一般使用int8量化, 在模型推理前需要把FP32映射为int8进行计算, 然后在输出的时候做一个去量化操作, 把计算的int8结果映射回FP32. 关于量化的3个问题: * 为什么不直接训练一个低精度的网络? 一般训练使用的是梯度下降法, 直接用 定点数做参数训练很容易导致梯度消失, 训练的模型会欠拟合, 所以训练阶段我们还是要用 浮点数 来做参数. * 为什么可以做量化? 神经网络模型一般有较好的抗干扰能力对噪声不敏感,量化相当于对原输入加入了大

  2. 大模型蒸馏

    4 min read
    大模型 · AI

    大模型蒸馏(Large Model Distillation),简单来说,就是将一个复杂的大模型(教师模型)的知识迁移到一个较小的模型(学生模型)中。就像老师把自己渊博的知识传授给学生,让学生能够在资源有限的情况下,尽可能地表现出和老师相似的能力。 大模型蒸馏的原理 大模型蒸馏借鉴了教育领域的“知识传递”概念,通过软标签的方式将教师模型的知识传递给学生模型。具体过程如下: * 教师模型的训练:首先训练一个大型的教师模型,使其达到较高的性能水平。 * 知识迁移:利用教师模型的输出(如概率分布、中间层特征等)作为软标签,指导学生模型的学习。软标签不仅包含正确类别的信息,还携带了类别之间的关系信息,使学生模型能够更有效地学习知识。 * 学生模型的优化:通过这些软标签,学生模型能够学习到教师模型的决策逻辑和特征表示,

  3. 提示词工程

    10 min read
    AI · 大模型

    提示词工程 什么是提示词工程? 提示词工程,或称Prompt Engineering,是一种专门针对语言模型进行优化的方法。它的目标是通过设计和调整输入的提示词(prompt),来引导这些模型生成更准确、更有针对性的输出文本。 在与大型预训练语言模型如GPT、DeepSeek等交互时,给定的提示词会极大地影响模型的响应内容和质量。提示词工程关注于如何创建最有效的提示词,以便让模型能够理解和满足用户的需求。这可能涉及到对不同场景的理解、使用正确的词汇和语法结构,以及尝试不同的提示策略以观察哪种效果最佳。 说白了就是提示词工程是一种通过优化输入文本来改进模型生成结果质量的方法。 拥有提示词工程能力,就拿到了释放大模型强大生产能力的钥匙。因为无论输入什么问题,大模型总能给出答案,但是要让它生成高质量的内容,就需要用户输入若干优质的提示词。对同一个大模型,给予不同的提示词会生成不同的结果。比如,“小白”用户利用绘画大模型生成的作品平淡无奇,而有经验的用户能用它生成夺人眼球甚至震撼人心的作品。 如何编写好提示词? * 提供尽可能多的上下文:你对大模型的要求解释得越详细,

  4. 大模型相关概念

    23 min read
    AI · 大模型

    什么是大模型? 大模型即大参数模型,就是指具有数千万甚至数亿参数的深度学习模型。近年来,随着计算机技术和大数据的快速发展,深度学习在各个领域取得了显著的成果,如自然语言处理,图片生成,工业数字化等。为了提高模型的性能,研究者们不断尝试增加模型的参数数量,从而诞生了大模型这一概念。 大模型通常由深度神经网络构建而成,拥有数十亿甚至数千亿个参数。大模型的设计目的是为了提高模型的表达能力和预测性能,能够处理更加复杂的任务和数据。 大模型采用预训练+微调的训练模式,在大规模数据上进行训练后,能快速适应一系列下游任务的模型。 什么是大语言模型LLM? 大语言模型(Large Language Model,LLM)是大模型的子分类,是专门通过处理大量文本数据来理解和生成人类语言的AI系统,从而执行各种自然语言处理任务,如文本分类、问答、对话、内容总结等。我们最为常见的ChatGPT、

  5. 离线部署Kubernetes-镜像下载

    10 min read

    离线条件下通过kubesphere部署Kubernetes,需要将镜像提前下载到离线环境的镜像仓库中 下载镜像 首先需要在有网络的电脑或服务器上讲镜像下载下来 pull-images.sh #!/bin/bash # docker pull registry.cn-beijing.aliyuncs.com/kubesphereio/kube-apiserver:v1.22.12 docker pull registry.cn-beijing.aliyuncs.com/kubesphereio/kube-controller-manager:v1.

  6. Gitlab Admin管理页面提示500内部错误(500 Internal error)的解决办法

    1 min read

    Gitlab迁移后,Admins管理区域大部分设置项无法保存,报500错误 排查后问题是: 数据无法通过gitlab-secrets.json解密 排查命令: sudo gitlab-rake gitlab:doctor:secrets 修复方式如下: 1.进入db控制台 sudo gitlab-rails dbconsole 2.使用以下指令修复 UPDATE projects SET runners_token = null, runners_token_encrypted = null; UPDATE

  7. Windows、Office 一键激活工具

    1 min read

    闲来无事搭建一个KMS激活服务器,独乐乐不如众乐乐,分享出来大家用 Windows 激活命令 slmgr /skms pin.lucent.blog && slmgr /ato 如果不会使用此命令或者此命令无效,请使用下方一键激活脚本 Windows、Office 一键激活脚本 下载地址: https://kms.lucent.blog/

  8. ToolBench样式指南

    4 min read

    内容修饰 标题 <tool-mtitle title="居中标题"></tool-mtitle> <tool-mtitle title="居中标题"></tool-mtitle> 小标签 type支持自定义 可以仿照插件中的相关CSS实现自定义小标签备注功能 <tool-sign type="

  9. [ChatGPT] 使用Python对接OpenAi APi 实现智能QQ机器人(五) - 接入互联网

    3 min read
    ChatGPT

    Openai于北京事件2023年6月14日,北美事件13日发布了新版本模型、gpt-3.5-turbo-0613、gpt-3.5-turbo-16k、gpt-3.5-turbo-16k-0613、gpt-4-0613。其中版本号带0613的支持函数调用,我们可以利用这一功能实现GPT接入互联网。 2023.06.15 17:00 更新: * 增加一个画图函数,让gpt能够调用画图函数 * 你可以自己修改成sd的画图接口 代码下载地址:https: