mirror of
https://github.com/datawhalechina/self-llm.git
synced 2026-08-28 15:11:50 +08:00
fix: docs path typo
This commit is contained in:
@@ -17,7 +17,7 @@ pip install datasets==2.10.1
|
||||
pip install accelerate==0.20.3
|
||||
```
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl),将基座模型参数放置在根目录 [/model](../model)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl),将基座模型参数放置在根目录 [/model](../../models)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -42,7 +42,7 @@ args = TrainingArguments(
|
||||
|
||||
if "__main__" == __name__:
|
||||
# 将JSON文件转换为CSV文件,处理数据集
|
||||
df = pd.read_json('../dataset/huanhuan.json')
|
||||
df = pd.read_json('../../dataset/huanhuan.json')
|
||||
ds = Dataset.from_pandas(df)
|
||||
# 加载tokenizer
|
||||
tokenizer = AutoTokenizer.from_pretrained("/root/autodl-tmp/THUCoAI/CharacterGLM-6B", trust_remote_code=True)
|
||||
|
||||
@@ -53,12 +53,12 @@
|
||||
},
|
||||
{
|
||||
"cell_type": "code",
|
||||
"execution_count": 2,
|
||||
"execution_count": null,
|
||||
"metadata": {},
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"# 将JSON文件转换为CSV文件\n",
|
||||
"df = pd.read_json('../dataset/huanhuan.json')\n",
|
||||
"df = pd.read_json('../../dataset/huanhuan.json')\n",
|
||||
"ds = Dataset.from_pandas(df)"
|
||||
]
|
||||
},
|
||||
|
||||
@@ -20,7 +20,7 @@ pip install datasets==2.10.1
|
||||
pip install accelerate==0.21.0
|
||||
```
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -37,7 +37,7 @@ args = TrainingArguments(
|
||||
|
||||
if "__main__" == __name__:
|
||||
# 将JSON文件转换为CSV文件,处理数据集
|
||||
df = pd.read_json('../dataset/huanhuan.json')
|
||||
df = pd.read_json('../../dataset/huanhuan.json')
|
||||
ds = Dataset.from_pandas(df)
|
||||
# 加载tokenizer
|
||||
tokenizer = AutoTokenizer.from_pretrained("/root/autodl-tmp/ZhipuAI/chatglm3-6b", trust_remote_code=True)
|
||||
|
||||
@@ -45,7 +45,7 @@ pip install datasets==2.20.0
|
||||
|
||||
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
|
||||
|
||||
|
||||
@@ -19,7 +19,7 @@ pip install tiktoken
|
||||
pip install transformers_stream_generator
|
||||
```
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -22,7 +22,7 @@ pip install transformers_stream_generator
|
||||
pip install bitsandbytes==0.41.1
|
||||
```
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -24,7 +24,7 @@
|
||||
},
|
||||
{
|
||||
"cell_type": "code",
|
||||
"execution_count": 2,
|
||||
"execution_count": null,
|
||||
"id": "e098d9eb",
|
||||
"metadata": {
|
||||
"tags": []
|
||||
@@ -32,7 +32,7 @@
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"# 将JSON文件转换为CSV文件\n",
|
||||
"df = pd.read_json('../dataset/huanhuan.json')\n",
|
||||
"df = pd.read_json('../../dataset/huanhuan.json')\n",
|
||||
"ds = Dataset.from_pandas(df)"
|
||||
]
|
||||
},
|
||||
|
||||
@@ -36,7 +36,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
|
||||
|
||||
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 AutoDL 平台准备了 GLM-4 的环境镜像,该镜像适用于本教程需要 GLM-4 的部署环境。点击下方链接并直接创建 AutoDL 示例即可。(vLLM 对 torch 版本要求较高,且越高的版本对模型的支持更全,效果更好,所以新建一个全新的镜像。) **https://www.codewithgpu.com/i/datawhalechina/self-llm/GLM-4**
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 模型下载
|
||||
|
||||
|
||||
@@ -24,7 +24,7 @@
|
||||
},
|
||||
{
|
||||
"cell_type": "code",
|
||||
"execution_count": 2,
|
||||
"execution_count": null,
|
||||
"id": "e098d9eb",
|
||||
"metadata": {
|
||||
"tags": []
|
||||
@@ -32,7 +32,7 @@
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"# 将JSON文件转换为CSV文件\n",
|
||||
"df = pd.read_json('../dataset/huanhuan.json')\n",
|
||||
"df = pd.read_json('../../dataset/huanhuan.json')\n",
|
||||
"ds = Dataset.from_pandas(df)"
|
||||
]
|
||||
},
|
||||
|
||||
@@ -37,7 +37,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
|
||||
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
|
||||
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 模型下载
|
||||
|
||||
|
||||
@@ -34,7 +34,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
|
||||
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
|
||||
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 模型下载
|
||||
|
||||
|
||||
@@ -31,7 +31,7 @@ pip install datasets peft
|
||||
> 考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Gemma2 的环境镜像,该镜像适用于该仓库的 Gemma2 教程所有部署环境。点击下方链接并直接创建Autodl示例即可。
|
||||
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-gemma2***
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -36,7 +36,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
|
||||
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 AutoDL 平台准备了 LLaMA3 的环境镜像,该镜像适用于该仓库的所有部署环境。点击下方链接并直接创建 Autodl 示例即可。
|
||||
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-LLaMA3***
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 模型下载
|
||||
|
||||
|
||||
@@ -21,7 +21,7 @@ pip install tiktoken
|
||||
pip install transformers_stream_generator
|
||||
```
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -33,7 +33,7 @@
|
||||
},
|
||||
{
|
||||
"cell_type": "code",
|
||||
"execution_count": 2,
|
||||
"execution_count": null,
|
||||
"id": "e098d9eb",
|
||||
"metadata": {
|
||||
"tags": []
|
||||
@@ -41,7 +41,7 @@
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"# 将JSON文件转换为CSV文件\n",
|
||||
"df = pd.read_json('../dataset/huanhuan.json')\n",
|
||||
"df = pd.read_json('../../dataset/huanhuan.json')\n",
|
||||
"ds = Dataset.from_pandas(df)"
|
||||
]
|
||||
},
|
||||
|
||||
@@ -33,7 +33,7 @@
|
||||
},
|
||||
{
|
||||
"cell_type": "code",
|
||||
"execution_count": 2,
|
||||
"execution_count": null,
|
||||
"id": "e098d9eb",
|
||||
"metadata": {
|
||||
"tags": []
|
||||
@@ -41,7 +41,7 @@
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"# 将JSON文件转换为CSV文件\n",
|
||||
"df = pd.read_json('../dataset/huanhuan.json')\n",
|
||||
"df = pd.read_json('../../dataset/huanhuan.json')\n",
|
||||
"ds = Dataset.from_pandas(df)"
|
||||
]
|
||||
},
|
||||
|
||||
@@ -22,7 +22,7 @@ pip install transformers_stream_generator
|
||||
pip install bitsandbytes==0.41.1
|
||||
```
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -40,7 +40,7 @@ pip install datasets==2.20.0
|
||||
> 考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Qwen1.5的环境镜像,该镜像适用于该仓库除Qwen-GPTQ和vllm外的所有部署环境。点击下方链接并直接创建Autodl示例即可。
|
||||
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-Qwen1.5***
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
|
||||
|
||||
|
||||
@@ -40,7 +40,7 @@ pip install datasets==2.20.0
|
||||
> 考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Qwen1.5的环境镜像,该镜像适用于该仓库除Qwen-GPTQ和vllm外的所有部署环境。点击下方链接并直接创建Autodl示例即可。
|
||||
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-Qwen1.5***
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
|
||||
|
||||
|
||||
@@ -37,7 +37,7 @@ pip install peft==0.13.2
|
||||
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/qwen2.5-coder***
|
||||
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -28,7 +28,7 @@ pip install peft==0.11.1
|
||||
|
||||
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 模型下载
|
||||
|
||||
|
||||
@@ -45,7 +45,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
|
||||
|
||||
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -24,7 +24,7 @@
|
||||
},
|
||||
{
|
||||
"cell_type": "code",
|
||||
"execution_count": 2,
|
||||
"execution_count": null,
|
||||
"id": "e098d9eb",
|
||||
"metadata": {
|
||||
"tags": []
|
||||
@@ -32,7 +32,7 @@
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"# 将JSON文件转换为CSV文件\n",
|
||||
"df = pd.read_json('../dataset/huanhuan.json')\n",
|
||||
"df = pd.read_json('../../dataset/huanhuan.json')\n",
|
||||
"ds = Dataset.from_pandas(df)"
|
||||
]
|
||||
},
|
||||
|
||||
@@ -53,7 +53,7 @@ print(f"模型下载完成,保存路径为:{model_dir}")
|
||||
}
|
||||
```
|
||||
|
||||
所有的示例微调数据集位于 [/dataset](../dataset/huanhuan.json)
|
||||
所有的示例微调数据集位于 [/dataset](../../dataset/huanhuan.json)
|
||||
|
||||
## 数据准备
|
||||
|
||||
|
||||
@@ -68,7 +68,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
|
||||
|
||||
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
|
||||
|
||||
在本节教程里,我们将微调数据集 `huanhuan.json` 放置在根目录 [/dataset](../dataset/huanhuan.json),该样本数据取自 [huanhuan.json](https://github.com/datawhalechina/self-llm/blob/master/dataset/huanhuan.json)
|
||||
在本节教程里,我们将微调数据集 `huanhuan.json` 放置在根目录 [/dataset](../../dataset/huanhuan.json),该样本数据取自 [huanhuan.json](https://github.com/datawhalechina/self-llm/blob/master/dataset/huanhuan.json)
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -19,7 +19,7 @@ pip install tiktoken
|
||||
pip install transformers_stream_generator
|
||||
```
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
|
||||
|
||||
## 指令集构建
|
||||
|
||||
|
||||
@@ -40,7 +40,7 @@ pip install datasets==2.20.0
|
||||
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 `AutoDL` 平台准备了 `Index-1.9B-Chat` 的环境镜像。点击下方链接并直接创建 `Autodl` 示例即可。
|
||||
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/Index***
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
|
||||
|
||||
|
||||
@@ -33,7 +33,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
|
||||
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 AutoDL 平台准备了 Phi-3 的环境镜像,该镜像适用于该仓库的所有部署环境。点击下方链接并直接创建 Autodl 示例即可。
|
||||
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/Phi-3-Lora***
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 模型下载
|
||||
|
||||
|
||||
@@ -24,7 +24,7 @@
|
||||
},
|
||||
{
|
||||
"cell_type": "code",
|
||||
"execution_count": 3,
|
||||
"execution_count": null,
|
||||
"id": "e098d9eb",
|
||||
"metadata": {
|
||||
"tags": []
|
||||
@@ -32,7 +32,7 @@
|
||||
"outputs": [],
|
||||
"source": [
|
||||
"# 将JSON文件转换为CSV文件\n",
|
||||
"df = pd.read_json('../dataset/huanhuan.json')\n",
|
||||
"df = pd.read_json('../../dataset/huanhuan.json')\n",
|
||||
"ds = Dataset.from_pandas(df)"
|
||||
]
|
||||
},
|
||||
@@ -242,7 +242,7 @@
|
||||
},
|
||||
"outputs": [
|
||||
{
|
||||
"name": "stdin",
|
||||
"name": "stdout",
|
||||
"output_type": "stream",
|
||||
"text": [
|
||||
"The repository for /root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct contains custom code which must be executed to correctly load the model. You can inspect the repository content at https://hf.co//root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct.\n",
|
||||
@@ -909,7 +909,7 @@
|
||||
]
|
||||
},
|
||||
{
|
||||
"name": "stdin",
|
||||
"name": "stdout",
|
||||
"output_type": "stream",
|
||||
"text": [
|
||||
"The repository for /root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct contains custom code which must be executed to correctly load the model. You can inspect the repository content at https://hf.co//root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct.\n",
|
||||
|
||||
@@ -37,7 +37,7 @@ pip install peft==0.11.1 # 用于 LoRA 微调
|
||||
|
||||
>考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Phi-4的环境镜像,点击下方链接并直接创建Autodl示例即可。 ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-phi4***
|
||||
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
|
||||
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
|
||||
|
||||
## 模型下载
|
||||
|
||||
|
||||
Reference in New Issue
Block a user