欧美亚洲。。制服国产三级,日本不卡高清免费中文av

一 LLama.cpp

LLama.cpp 支持x86，arm，gpu的編譯。

github下載llama.cpp

https://github.com/ggerganov/llama.cpp.git

2. gem5支持arm架構(gòu)比較好，所以我們使用編譯LLama.cpp。

以下是我對(duì)Makefile的修改

開始編譯：

make UNAME_M=aarch64

編譯會(huì)使用到aarch64-linux-gnu-gcc-10，編譯成功可以生成一個(gè)main 文件，這里我把main重命名成main_arm_backup了。

可以使用file main查看一下文件：

3. 下載一個(gè)大模型的model到llama.cpp/models的目錄下，這里我下載了llama-2-7b-chat.Q2_K.gguf。

這個(gè)模型2bit量化，跑起來(lái)不到3G的內(nèi)存。

GGML_TYPE_Q2_K - "type-1" 2-bit quantization in super-blocks containing 16 blocks, each block having 16 weight. Block scales and mins are quantized with 4 bits. This ends up effectively using 2.5625 bits per weight (bpw)

4.此時(shí)我們可以本地運(yùn)行以下main和模型，我的prompt是How are you

./main -m ./models/llama-2-7b-chat.Q2_K.gguf -p "How are you"-n 16

下圖最下面一行就是模型自動(dòng)生成的

二 gem5

gem5下載編譯好后，我們可以使用gem5.fast運(yùn)行模型了。

build/ARM/gem5.fast

--outdir=./m5out/llm_9

./configs/example/se.py -c

$LLAMA_path/llama.cpp/main-arm

'--options=-m $LLAMA_path/llama-2-7b-chat.Q2_K.gguf -p Hi -n 16'

--cpu-type=ArmAtomicSimpleCPU --mem-size=8GB -n 8

此時(shí)我的prompt是Hi，預(yù)期是n=8，跑8核。

上圖是gem5運(yùn)行大模型時(shí)生成的simout，我增加了AtomicCPU 運(yùn)行指令數(shù)量的打印，這是在gem5的改動(dòng)。

如果你下載的是gem5的源碼，那么現(xiàn)在運(yùn)行起來(lái)應(yīng)該只是最前面大模型的輸出。

模型的回答是Hi，I'm a30-year-old male, and 但是我預(yù)期的是8核，實(shí)際上運(yùn)行起來(lái)：

可以看出來(lái)，實(shí)際上只跑起來(lái)4核，定位后發(fā)現(xiàn)，模型默認(rèn)是4核，需要增加-t 8選項(xiàng)，即threadnumber設(shè)置成8，下面的紅色標(biāo)注的command.

build/ARM/gem5.fast

--outdir=./m5out/llm_9

./configs/example/se.py -c

$LLAMA_path/llama.cpp/main-arm

'--options=-m$LLAMA_path/llama-2-7b-chat.Q2_K.gguf -p Hi -n 16 -t 8'

--cpu-type=ArmAtomicSimpleCPU --mem-size=8GB -n8

如上圖所示，8核都跑起來(lái)了，處理到Hi這個(gè)token的時(shí)候，CPU0執(zhí)行了2.9 Billion指令，相對(duì)于4核時(shí)的5.4 Billion約減少了一半。

審核編輯：劉清

聲明：本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題，請(qǐng)聯(lián)系本站處理。舉報(bào)投訴

ARM

ARM

+關(guān)注

關(guān)注
134

文章
9176

瀏覽量
369324
gpu

gpu

+關(guān)注

關(guān)注
28

文章
4783

瀏覽量
129382
Linux系統(tǒng)

Linux系統(tǒng)

+關(guān)注

關(guān)注
4

文章
596

瀏覽量
27521
大模型

大模型

+關(guān)注

關(guān)注
2

文章
2567

瀏覽量
3190

原文標(biāo)題：大模型筆記【3】 gem5 運(yùn)行模型框架LLama

文章出處：【微信號(hào)：處理器與AI芯片，微信公眾號(hào)：處理器與AI芯片】歡迎添加關(guān)注！文章轉(zhuǎn)載請(qǐng)注明出處。

評(píng)論

相關(guān)推薦

RISC-V 跑大模型（三）：LLaMA中文擴(kuò)展

這是RISC-V跑大模型系列的第三篇文章，前面我們?yōu)榇蠹?b class='flag-5'>介紹了如何在RISC-V下運(yùn)行LLaMA，本篇我們將會(huì)介紹如何為

發(fā)表于 07-17 17:15 ?883次閱讀

RISC-V 跑大<b class='flag-5'>模型</b>（三）：<b class='flag-5'>LLaMA</b>中文擴(kuò)展

【飛騰派4G版免費(fèi)試用】仙女姐姐的嵌入式實(shí)驗(yàn)室之五~LLaMA.cpp及3B“小模型”O(jiān)penBuddy-StableLM-3B

，根據(jù)LLaMA官方的介紹，要想運(yùn)行該模型需要30GB左右顯存的顯卡支持，這是邊緣終端甚至個(gè)人電腦難以做到的，后來(lái)，GitHub上的一位開發(fā)者ggerganov發(fā)布了

發(fā)表于 12-22 10:18

在gem5中支持Arm TME的工作資料推薦

1、在gem5里支持armv9 Transactional Memory (TME)擴(kuò)展微處理器的順序執(zhí)行性能到了停滯期，產(chǎn)業(yè)界將通過(guò)增加核心數(shù)量來(lái)提升更多的性能。結(jié)果就是軟件編程從純順序編程模型

發(fā)表于 08-05 15:14

SECS/GEM標(biāo)準(zhǔn)模型分析及應(yīng)用

SECS/GEM是半導(dǎo)體自動(dòng)化生產(chǎn)中廣泛采用的一個(gè)行業(yè)標(biāo)準(zhǔn)。首先介紹了SECS/GEM標(biāo)準(zhǔn)的整體框架，并分析了其行業(yè)發(fā)展?fàn)顩r，然后依次說(shuō)明了SECSⅠ/Ⅱ、

發(fā)表于 08-01 14:25 ?72次下載

SECS/<b class='flag-5'>GEM</b>標(biāo)準(zhǔn)<b class='flag-5'>模型</b>分析及應(yīng)用

Gem5 Arm Fullsystem仿真

如果是基于X86 Ubuntu系統(tǒng)模擬gem5 arch，制作disk image比較簡(jiǎn)單，可以git clone gem5 resource, 在spec2017文件夾

發(fā)表于 01-04 14:11 ?2271次閱讀

Meta發(fā)布開源大模型Code Llama 70B

近日，Meta宣布推出了一款新的開源大模型Code Llama 70B，這是其“Code Llama家族中體量最大、性能最好的模型版本”。這款新模型

發(fā)表于 01-31 09:24 ?1043次閱讀

Meta Llama 3基礎(chǔ)模型現(xiàn)已在亞馬遜云科技正式可用

亞馬遜云科技近日宣布，Meta公司最新發(fā)布的兩款Llama 3基礎(chǔ)模型——Llama 3 8B和Llama 3 70B，現(xiàn)已正式上線并集成至Amazon SageMaker JumpS

發(fā)表于 05-09 10:39 ?456次閱讀

英偉達(dá)發(fā)布AI模型 Llama-3.1-Nemotron-51B AI模型

速度比原70B大模型提升2.2倍，具備更準(zhǔn)確和更高效的運(yùn)算效率；能夠大幅降低運(yùn)行成本。 ? ? ? 通過(guò)NAS技術(shù)微調(diào)；大幅降低了內(nèi)存消耗、計(jì)算復(fù)雜性；Llama-3.1-Nemotron-51B AI

發(fā)表于 09-26 17:30 ?662次閱讀

亞馬遜云科技正式上線Meta Llama 3.2模型

亞馬遜云科技宣布，Meta的新一代模型Llama 3.2，包括其首款多模態(tài)模型，現(xiàn)已在Amazon Bedrock和Amazon SageMaker中正式可用。

發(fā)表于 10-11 09:20 ?560次閱讀

亞馬遜云科技上線Meta Llama 3.2模型

亞馬遜云科技近日宣布，Meta公司的新一代模型Llama 3.2已在其平臺(tái)上正式上線。該模型包括Meta首款多模態(tài)模型，現(xiàn)已在Amazon Bedrock和Amazon SageMak

發(fā)表于 10-11 18:08 ?511次閱讀

Llama 3 語(yǔ)言模型應(yīng)用

在人工智能領(lǐng)域，語(yǔ)言模型的發(fā)展一直是研究的熱點(diǎn)。隨著技術(shù)的不斷進(jìn)步，我們見(jiàn)證了從簡(jiǎn)單的關(guān)鍵詞匹配到復(fù)雜的上下文理解的轉(zhuǎn)變。一、Llama 3 語(yǔ)言模型的核心功能上下文理解：Llama

發(fā)表于 10-27 14:15 ?377次閱讀

Llama 3 模型訓(xùn)練技巧

Llama 3 模型，假設(shè)是指一個(gè)先進(jìn)的人工智能模型，可能是一個(gè)虛構(gòu)的或者是一個(gè)特定領(lǐng)域的術(shù)語(yǔ)。 1. 數(shù)據(jù)預(yù)處理數(shù)據(jù)是任何機(jī)器學(xué)習(xí)模型的基礎(chǔ)。在訓(xùn)練之前，確保數(shù)據(jù)質(zhì)量至關(guān)重要。數(shù)

發(fā)表于 10-27 14:24 ?424次閱讀

Meta發(fā)布Llama 3.2量化版模型

近日，Meta在開源Llama 3.2的1B與3B模型后，再次為人工智能領(lǐng)域帶來(lái)了新進(jìn)展。10月24日，Meta正式推出了這兩個(gè)模型的量化版本，旨在進(jìn)一步優(yōu)化模型性能，拓寬其應(yīng)用場(chǎng)景。

發(fā)表于 10-29 11:05 ?478次閱讀

用Ollama輕松搞定Llama 3.2 Vision模型本地部署

Ollama 是一個(gè)開源的大語(yǔ)言模型服務(wù)工具，它的核心目的是簡(jiǎn)化大語(yǔ)言模型（LLMs）的本地部署和運(yùn)行過(guò)程，請(qǐng)參考《Gemma 2+Ollama在算力魔方上幫你在LeetCode解題》，一條命令完成

發(fā)表于 11-23 17:22 ?1798次閱讀

大語(yǔ)言模型開發(fā)框架是什么

大語(yǔ)言模型開發(fā)框架是指用于訓(xùn)練、推理和部署大型語(yǔ)言模型的軟件工具和庫(kù)。下面，AI部落小編為您介紹大語(yǔ)言模型開發(fā)

發(fā)表于 12-06 10:28 ?191次閱讀

欧美性猛交xxxx免费看_牛牛在线视频国产免费_天堂草原电视剧在线观看免费_国产粉嫩高清在线观看_国产欧美日本亚洲精品一5区

搜索歷史

大模型筆記之gem5運(yùn)行模型框架LLama介紹

評(píng)論

RISC-V 跑大模型（三）：LLaMA中文擴(kuò)展

【飛騰派4G版免費(fèi)試用】仙女姐姐的嵌入式實(shí)驗(yàn)室之五~LLaMA.cpp及3B“小模型”O(jiān)penBuddy-StableLM-3B

在gem5中支持Arm TME的工作資料推薦

SECS/GEM標(biāo)準(zhǔn)模型分析及應(yīng)用

Gem5 Arm Fullsystem仿真

Meta發(fā)布開源大模型Code Llama 70B

Meta Llama 3基礎(chǔ)模型現(xiàn)已在亞馬遜云科技正式可用

英偉達(dá)發(fā)布AI模型 Llama-3.1-Nemotron-51B AI模型

亞馬遜云科技正式上線Meta Llama 3.2模型

亞馬遜云科技上線Meta Llama 3.2模型

Llama 3 語(yǔ)言模型應(yīng)用

Llama 3 模型訓(xùn)練技巧

Meta發(fā)布Llama 3.2量化版模型

用Ollama輕松搞定Llama 3.2 Vision模型本地部署

大語(yǔ)言模型開發(fā)框架是什么