Lucent's Blog

Lucent's Blog

当时明月在 曾照彩云归


人生不相见,动如参与商。


大模型

  1. 昇腾910B部署千问3(Qwen3)大模型-封装推理镜像

    7 min read
    AI · 大模型

    上一个文章,我们已经成功在昇腾910B平台上部署了Qwen3,现在我们就利用已经配置好环境的容器,制作一个专门方便部署的推理镜像 制作镜像 编写python脚本用来自动设置推理配置文件 vim /usr/local/Ascend/update_mindie_config.py 在文件中写入下面的代码 import sys import json import argparse import os parser = argparse.ArgumentParser(description="") parser.add_argument("--model&

  2. 昇腾910B部署千问3(Qwen3)大模型

    5 min read
    AI · 大模型

    终于拿到了华为的最新版本Mindie镜像 mindie_2.0.T17.B010-800I-A2-py3.11-openeuler24.03-lts-aarch64.tar.gz 终于可以在昇腾平台上部署Qwen3了 Qwen3简介 Qwen3是Qwen系列中最新一代的大型语言模型,提供了密集和混合专家(MoE)模型的全面套件。基于广泛的训练,Qwen3在推理、指令遵循、代理功能和多语言支持方面取得了很大的进展,主要具有以下功能: * 思维模式(用于复杂的逻辑推理、数学和编码)和非思维模式(用于高效、通用的对话)在单个模型内无缝切换,

  3. 使用vllm-ascend在昇腾910B部署千问3(Qwen3)

    2 min read
    大模型 · AI

    千问3已经发布几天了,华为公开最新的Mindeie镜像,我们可以暂时使用vllm-ascend进行推理 下载镜像 docker pull quay.io/ascend/vllm-ascend:v0.8.4rc2 下载模型 我们这里以Qwen3-32B为例,其它模型同理 权重在这里下载: https://www.modelscope.cn/models/Qwen/Qwen3-32B 下载到你想要的位置 编写启动命令 docker run --rm -d

  4. AI时代的网站新身份证:LLMs.txt介绍

    3 min read
    大模型 · AI

    LLMs.txt:AI 时代的新型网络标准解析 在当今快速发展的 AI 时代,一个新的网络标准正在悄然兴起 —— LLMs.txt。这个标准虽然简单,却可能对未来的 AI 搜索和内容理解产生深远影响。今天,让我们一起深入了解这个创新性的提案。 什么是 LLMs.txt? LLMs.txt 是一个为大语言模型(LLMs)优化的网站内容标准。与面向搜索引擎的 robots.txt 和 sitemap.xml 不同,LLMs.txt 专门设计用于帮助

  5. AI 应用程序

    2 min read
    大模型 · AI

    AI 应用程序并没有官方概念,简单来说就是一个程序中应用到了AI,这个程序就可以算是AI 应用程序 为什么开发AI应用程序? 大模型的能力很强大,但是如果我们只是把它应用在对话方面,那就太大材小用了。 我们之前讲过了RAG和Agent智能体,那么我们如何在生活中或者生产中使用它们呢? 为了更方便的使用,比如知识库,我们就可以通过代码,编写一套系统,将RAG的相关内容开发进这套系统中,为用户提供一个可视化页面,用户能够方便的使用RAG知识库,这套系统就是AI应用程序。 同样的,如果我们厌倦了手动编写PPT,那么是不是可以利用大模型来生成PPT?答案是可以的,我们通过代码开发一套系统,代码中提前设置好相关的提示词,比如根据用户给的资料生成PPT大纲(具体提示词怎么写,可以参考02_提示词工程),然后在通过代码告诉模型对它自己生成的大纲进行内容补充,最后把模型生成的标题、内容全部替换进提前准备好的PPT模板,就自动生成了一个PPT,这个过程中,

  6. AI Agent 智能体

    4 min read
    AI · 大模型

    智能体是什么 智能体的英文是 Agent,AI 业界对智能体提出了各种定义。个人理解,智能体是一种通用问题解决器。从软件工程的角度看来,智能体是一种基于大语言模型的,具备规划思考能力、记忆能力、使用工具函数的能力,能自主完成给定任务的计算机程序。 大语言模型很强大,就像人类的大脑一样拥有思考的能力。如果人类只有大脑,没有四肢,没有工具,是没办法与世界互动的。如果我们能给大模型配备上四肢和工具呢?大模型是不是就会打破次元壁,从数字世界走向现实世界,与现实世界实现梦幻联动呢? 大语言模型(后文将用 LLM 指代)可以接受输入,可以分析&推理、可以输出文字\代码\媒体。

  7. 基于RAG的聊天引擎

    1 min read
    AI · 大模型

    构建一个可以在单个查询中多次运行RAG系统的一个重要特性是聊天逻辑,考虑到对话上下文,就像在 LLM 时代之前的经典聊天机器人一样。这是支持后续问题,重复指代,或任意用户命令相关的以前对话上下文所必需的。查询压缩技术可以同时考虑聊天上下文和用户查询。 有几种方法可以实现上下文压缩: 一种流行且相对简单的 ContextChatEngine,首先检索与用户查询相关的上下文,然后将其连同聊天历史从存缓发送给 LLM,让 LLM 在生成下一个答案时能够意识到前一个上下文。 另一种更复杂的实现是 CondensePlusContextMode,在每次交互中,聊天历史记录和最后一条消息被压缩成一个新的查询(这个查询是由模型自行生成的),然后这个查询进入索引,检索到的上下文被传递给 LLM连同原始用户消息来生成一个答案。

  8. RAG相关知识

    19 min read
    AI · 大模型

    RAG 全称 Retrieval-Augmented Generation,翻译成中文是检索增强生成。检索指的是检索外部知识库,增强生成指的是将检索到的知识送给大语言模型以此来优化大模型的生成结果,使得大模型在生成更精确、更贴合上下文答案的同时,也能有效减少产生误导性信息的可能。 为什么需要RAG? 之所以需要 RAG,是因为大语言模型本身存在一些局限性。 1.时效性 模型的训练是基于截至某一时间点之前的数据集完成的。这意味着在该时间点之后发生的任何事件、新发现、新趋势或数据更新都不会反映在模型的知识中。例如,我的训练数据在 2023 年底截止,之后发生的事情我都无法了解。另外,大型模型的训练涉及巨大的计算资源和时间。这导致频繁更新模型以包括最新信息是不现实的,尤其是在资源有限的情况下。 2.覆盖性 虽然大模型的训练数据集非常庞大,但仍可能无法涵盖所有领域的知识或特定领域的深度信息。

  9. 模型量化

    3 min read
    AI · 大模型

    模型量化(quantization)指的是用更少的bit表示模型参数,从而减少模型的大小,加速推理过程的技术。 模型量化是把模型的参数从FP32映射到nbit位的过程, 简单来说就是在定点数与浮点数等数据之间建立一种数据映射关系, 使得以较小的精度损失代价获得了较好的收益。 例如FP32-->INT8可以实现4倍的参数压缩,在压缩内存的同时可以实现更快速的计算,从而有效地提高模型的性能; 最极端的二值量化理论上甚至可以实现32倍的压缩,但是过度的压缩会导致模型的精度快速下降, 所以更多量化的时候需要做好精度和性能的权衡. 工业界一般使用int8量化, 在模型推理前需要把FP32映射为int8进行计算, 然后在输出的时候做一个去量化操作, 把计算的int8结果映射回FP32. 关于量化的3个问题: * 为什么不直接训练一个低精度的网络? 一般训练使用的是梯度下降法, 直接用 定点数做参数训练很容易导致梯度消失, 训练的模型会欠拟合, 所以训练阶段我们还是要用 浮点数 来做参数. * 为什么可以做量化? 神经网络模型一般有较好的抗干扰能力对噪声不敏感,量化相当于对原输入加入了大

  10. 大模型蒸馏

    4 min read
    大模型 · AI

    大模型蒸馏(Large Model Distillation),简单来说,就是将一个复杂的大模型(教师模型)的知识迁移到一个较小的模型(学生模型)中。就像老师把自己渊博的知识传授给学生,让学生能够在资源有限的情况下,尽可能地表现出和老师相似的能力。 大模型蒸馏的原理 大模型蒸馏借鉴了教育领域的“知识传递”概念,通过软标签的方式将教师模型的知识传递给学生模型。具体过程如下: * 教师模型的训练:首先训练一个大型的教师模型,使其达到较高的性能水平。 * 知识迁移:利用教师模型的输出(如概率分布、中间层特征等)作为软标签,指导学生模型的学习。软标签不仅包含正确类别的信息,还携带了类别之间的关系信息,使学生模型能够更有效地学习知识。 * 学生模型的优化:通过这些软标签,学生模型能够学习到教师模型的决策逻辑和特征表示,