JustinChen的博客
首页
小说
推荐页
归档
分类
标签
关于
JustinChen
累计撰写
53
篇文章
累计创建
11
个分类
累计收到
2
条评论
导航
首页
小说
推荐页
归档
分类
标签
关于
目录
标签
LLM
【大模型实践】vLLM开启FlashInfer
2025-04-07 11:58
886
0
0
112.6℃
配置/部署
安装 flash-attn 很多人可能直接使用pip命令安装,网上给的教程也直接是放一行命令就不管,稳妥一点的办法是直接下载源码安装,这样就没有了兼容性问题。 首先查看本机的python、pytorch、cuda版本,比如我的环境是python==3.12,torch==2.6,cuda 12 进入
【大模型】Qwen2.5-Omni 技术报告
报告链接:Qwen2.5-Omni Technical Report 1 概述 下图为Omni的应用场景概述图,主要思想就是让多模态数据(文字、图片、视频、音频)输入模型,然后通过文字大模型(Thinker)进行理解,然后配合语音大模型(Talker)进行语音输出。 它的整体架构如下: 2 技术细节
2025-03-29 16:20
43
0
0
28.3℃
人工智能
【大模型实践】Lora微调Qwen2.5-1.5B大模型(外科问诊)
2025-03-15 18:25
14
0
0
25.4℃
人工智能
实验所用的设备是单卡4090 24GB,在验证阶段使用了KV cache所以总共需要至少21GB的显存,才推荐完成这个微调操作。 在10万左右训练数据集、使用Lora方法、半精度主干网络权重、3 Epoch的情况下,单卡微调时间大约3小时半。 0 原始数据预处理 0.1 构造指令微调数据 这一步主要
【大模型优化】利用GLU改进FFN
2025-03-12 08:47
198
0
1
45.8℃
人工智能
1 GLU 结构 如上图所示,激活函数使用swish为例(这是可以替换的),GLU 引入了两个升维线性层,GLU线性门控单元的FFN块计算公式: \text{GLU}(x) = xV \cdot \sigma(xW + b) \quad FFN_{GLU} = (xV \cdot \sigma(xW
【大模型优化】长度外推问题
2025-03-10 17:42
68
0
0
30.8℃
人工智能
长度外推问题,就是要考虑编码的维度,又要考虑能表示的范围 这是一个在机器学习领域常见问题,包括从线性回归开始就有类似的问题,也就是如何让机器理解和表达训练数据数值范围之外的数据。 1 进制表示到直接外推 进制表示: 假设我们有一个1000以内(不包含1000)的整数N要作为条件输入到模型中,那么要以
【大模型】位置编码
2025-03-10 16:24
18
0
0
25.8℃
人工智能
1 绝对位置编码 1.1 Transformer的位置编码 加在embedding上,但是由于使用的是sin、cos 交替,可以通过线性变换矩阵得到其他位置的表示,所以可以期望他包含了相对位置的信息,而且由于三角函数有显示的生成规律,所以可以期望有外推性质 PE(Positional Encodin
【大模型预训练】数据预处理
2025-03-09 17:45
14
0
0
25.4℃
人工智能
1 数据来源 整个预训练阶段最重要的就是数据的获取和处理。预训练的数据量级在10T tokens,继续预训练则至少在100B tokens 的量级 预训练阶段涉及学习大量数据,以全面了解世界及其各种复杂性。这不仅包括基本的语言能力,还包括诸如math、code和逻辑推理等高级技能,所以需要收集大量的
【大模型优化】常见激活函数
2025-03-09 10:35
84
0
0
32.4℃
人工智能
1 Sigmoid 缺点: 输入较大或较小时候梯度接近于0,容易导致梯度消失 函数输出不是以 0 为中心的,梯度可能就会向特定方向移动,从而降低权重更新的效率 Sigmoid 函数执行指数运算,计算机运行得较慢,比较消耗计算资源 f(x) = \frac{1}{1 + e^{-x}} f'(x) =
【大模型优化】Attention计算复杂度优化
2025-03-08 21:01
34
0
0
27.4℃
人工智能
1 Sparse Attention 主要思想是认为多数情况下,长距离的注意力是少数的,所以削减远距离注意力,成为稀疏注意力机制。 如下为原本的注意力权重分布: 从注意力矩阵上看除了相对距离不超过k的、相对距离为k,2k,3k,…的注意力都设为0 ,这样一来Attention就具有“局部紧密相关和远
【大模型实践】开源项目NanoGPT实践
2025-03-08 14:08
22
0
0
26.2℃
人工智能
1 参数 n_head = 4 # 多头注意力的头数 n_layer = 4 # transformer层数 dropout = 0.0 # dropout率 context_size = 32 embd_dim = 64 batch_size = 16 lr = 1e-3 epochs =
【大模型】文本大模型的Embedding
2025-03-07 18:57
12
0
0
25.2℃
人工智能
1 介绍 关于词向量与Embedding: Embedding是以每个字在给定分布随机初始化的随机向量而组成的可学习参数矩阵,也就是一个全连接Dense层,其以onehot为输入,稠密向量为输出,即词向量,因此在实现上,用lookup查表来代替矩阵乘积以提高性能。PyTorch中常用的实现为nn.E
【大模型】文本大模型的Tokenization
2025-03-07 16:49
35
0
0
27.5℃
人工智能
1 分词粒度 1.1 词粒度 word 英文天生空格分开词汇,中文可以使用jieba分词工具 优点: 词的边界和含义得到保留 缺点: 词粒度的词表由于长尾效应可能会非常大,包含很多的稀有词,存储和训练的成本都很高,并且稀有词往往很难学好 OOV(out of vocabulary)问题,对于词表之外
【大模型】Full-FT与BitFit
2025-03-01 17:37
29
0
0
26.9℃
人工智能
1 全参数微调(Full-FT) 顾名思义,全参微调(Full-Fine-tuning)类似于预训练阶段,使用目标领域的少量语料对整个模型进行微调。这种方法虽然实现简单,但灵活性较低,且对计算资源的需求较高。 2 BitFit 原论文:[2106.10199] BitFit: Simple Para
【大模型】大模型量化
2025-02-24 20:39
10
0
0
25.0℃
人工智能
1 大模型量化基础 1.1 极大值量化(对称量化) 1.2 零点量化(非对称量化) 2 量化 2.1 动态量化 运行时量化:在模型推理阶段,动态计算激活值的量化参数,以适应不同的输入数据。 量化范围:通常仅对权重进行预量化,而激活值则在推理时实时量化。 数据依赖:
【大模型】Adapter系列微调方法
2025-01-02 16:54
51
0
0
29.1℃
人工智能
1. Adapter Tuning Adapter Tuning 通过在 Transformer 的 多头注意力机制 和 FFN 之后插入 瓶颈结构 的 Adapter 模块,实现了参数高效微调。其设计简单、高效且通用,适用于多种任务和模型。 2. Adapter Fusion AdapterFus
弹