fix: docs path typo

This commit is contained in:
Zhenyu Pan
2025-05-04 00:04:49 +08:00
parent b7eeeb5748
commit 997516b793
32 changed files with 41 additions and 41 deletions
+1 -1
View File
@@ -17,7 +17,7 @@ pip install datasets==2.10.1
pip install accelerate==0.20.3
```
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl),将基座模型参数放置在根目录 [/model](../model)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl),将基座模型参数放置在根目录 [/model](../../models)。
## 指令集构建
@@ -42,7 +42,7 @@ args = TrainingArguments(
if "__main__" == __name__:
# 将JSON文件转换为CSV文件,处理数据集
df = pd.read_json('../dataset/huanhuan.json')
df = pd.read_json('../../dataset/huanhuan.json')
ds = Dataset.from_pandas(df)
# 加载tokenizer
tokenizer = AutoTokenizer.from_pretrained("/root/autodl-tmp/THUCoAI/CharacterGLM-6B", trust_remote_code=True)
@@ -53,12 +53,12 @@
},
{
"cell_type": "code",
"execution_count": 2,
"execution_count": null,
"metadata": {},
"outputs": [],
"source": [
"# 将JSON文件转换为CSV文件\n",
"df = pd.read_json('../dataset/huanhuan.json')\n",
"df = pd.read_json('../../dataset/huanhuan.json')\n",
"ds = Dataset.from_pandas(df)"
]
},
+1 -1
View File
@@ -20,7 +20,7 @@ pip install datasets==2.10.1
pip install accelerate==0.21.0
```
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
## 指令集构建
+1 -1
View File
@@ -37,7 +37,7 @@ args = TrainingArguments(
if "__main__" == __name__:
# 将JSON文件转换为CSV文件,处理数据集
df = pd.read_json('../dataset/huanhuan.json')
df = pd.read_json('../../dataset/huanhuan.json')
ds = Dataset.from_pandas(df)
# 加载tokenizer
tokenizer = AutoTokenizer.from_pretrained("/root/autodl-tmp/ZhipuAI/chatglm3-6b", trust_remote_code=True)
@@ -45,7 +45,7 @@ pip install datasets==2.20.0
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
@@ -19,7 +19,7 @@ pip install tiktoken
pip install transformers_stream_generator
```
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 指令集构建
@@ -22,7 +22,7 @@ pip install transformers_stream_generator
pip install bitsandbytes==0.41.1
```
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 指令集构建
@@ -24,7 +24,7 @@
},
{
"cell_type": "code",
"execution_count": 2,
"execution_count": null,
"id": "e098d9eb",
"metadata": {
"tags": []
@@ -32,7 +32,7 @@
"outputs": [],
"source": [
"# 将JSON文件转换为CSV文件\n",
"df = pd.read_json('../dataset/huanhuan.json')\n",
"df = pd.read_json('../../dataset/huanhuan.json')\n",
"ds = Dataset.from_pandas(df)"
]
},
+1 -1
View File
@@ -36,7 +36,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 AutoDL 平台准备了 GLM-4 的环境镜像,该镜像适用于本教程需要 GLM-4 的部署环境。点击下方链接并直接创建 AutoDL 示例即可。(vLLM 对 torch 版本要求较高,且越高的版本对模型的支持更全,效果更好,所以新建一个全新的镜像。) **https://www.codewithgpu.com/i/datawhalechina/self-llm/GLM-4**
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 模型下载
@@ -24,7 +24,7 @@
},
{
"cell_type": "code",
"execution_count": 2,
"execution_count": null,
"id": "e098d9eb",
"metadata": {
"tags": []
@@ -32,7 +32,7 @@
"outputs": [],
"source": [
"# 将JSON文件转换为CSV文件\n",
"df = pd.read_json('../dataset/huanhuan.json')\n",
"df = pd.read_json('../../dataset/huanhuan.json')\n",
"ds = Dataset.from_pandas(df)"
]
},
@@ -37,7 +37,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 模型下载
@@ -34,7 +34,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 模型下载
@@ -31,7 +31,7 @@ pip install datasets peft
> 考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Gemma2 的环境镜像,该镜像适用于该仓库的 Gemma2 教程所有部署环境。点击下方链接并直接创建Autodl示例即可。
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-gemma2***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 指令集构建
@@ -36,7 +36,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 AutoDL 平台准备了 LLaMA3 的环境镜像,该镜像适用于该仓库的所有部署环境。点击下方链接并直接创建 Autodl 示例即可。
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-LLaMA3***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 模型下载
+1 -1
View File
@@ -21,7 +21,7 @@ pip install tiktoken
pip install transformers_stream_generator
```
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
## 指令集构建
@@ -33,7 +33,7 @@
},
{
"cell_type": "code",
"execution_count": 2,
"execution_count": null,
"id": "e098d9eb",
"metadata": {
"tags": []
@@ -41,7 +41,7 @@
"outputs": [],
"source": [
"# 将JSON文件转换为CSV文件\n",
"df = pd.read_json('../dataset/huanhuan.json')\n",
"df = pd.read_json('../../dataset/huanhuan.json')\n",
"ds = Dataset.from_pandas(df)"
]
},
@@ -33,7 +33,7 @@
},
{
"cell_type": "code",
"execution_count": 2,
"execution_count": null,
"id": "e098d9eb",
"metadata": {
"tags": []
@@ -41,7 +41,7 @@
"outputs": [],
"source": [
"# 将JSON文件转换为CSV文件\n",
"df = pd.read_json('../dataset/huanhuan.json')\n",
"df = pd.read_json('../../dataset/huanhuan.json')\n",
"ds = Dataset.from_pandas(df)"
]
},
@@ -22,7 +22,7 @@ pip install transformers_stream_generator
pip install bitsandbytes==0.41.1
```
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
## 指令集构建
@@ -40,7 +40,7 @@ pip install datasets==2.20.0
> 考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Qwen1.5的环境镜像,该镜像适用于该仓库除Qwen-GPTQ和vllm外的所有部署环境。点击下方链接并直接创建Autodl示例即可。
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-Qwen1.5***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
@@ -40,7 +40,7 @@ pip install datasets==2.20.0
> 考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Qwen1.5的环境镜像,该镜像适用于该仓库除Qwen-GPTQ和vllm外的所有部署环境。点击下方链接并直接创建Autodl示例即可。
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-Qwen1.5***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
@@ -37,7 +37,7 @@ pip install peft==0.13.2
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/qwen2.5-coder***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 指令集构建
@@ -28,7 +28,7 @@ pip install peft==0.11.1
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 模型下载
@@ -45,7 +45,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 指令集构建
+2 -2
View File
@@ -24,7 +24,7 @@
},
{
"cell_type": "code",
"execution_count": 2,
"execution_count": null,
"id": "e098d9eb",
"metadata": {
"tags": []
@@ -32,7 +32,7 @@
"outputs": [],
"source": [
"# 将JSON文件转换为CSV文件\n",
"df = pd.read_json('../dataset/huanhuan.json')\n",
"df = pd.read_json('../../dataset/huanhuan.json')\n",
"ds = Dataset.from_pandas(df)"
]
},
@@ -53,7 +53,7 @@ print(f"模型下载完成,保存路径为:{model_dir}")
}
```
所有的示例微调数据集位于 [/dataset](../dataset/huanhuan.json)
所有的示例微调数据集位于 [/dataset](../../dataset/huanhuan.json)
## 数据准备
@@ -68,7 +68,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
> 注意:flash-attn 安装会比较慢,大概需要十几分钟。
在本节教程里,我们将微调数据集 `huanhuan.json` 放置在根目录 [/dataset](../dataset/huanhuan.json),该样本数据取自 [huanhuan.json](https://github.com/datawhalechina/self-llm/blob/master/dataset/huanhuan.json)
在本节教程里,我们将微调数据集 `huanhuan.json` 放置在根目录 [/dataset](../../dataset/huanhuan.json),该样本数据取自 [huanhuan.json](https://github.com/datawhalechina/self-llm/blob/master/dataset/huanhuan.json)
## 指令集构建
+1 -1
View File
@@ -19,7 +19,7 @@ pip install tiktoken
pip install transformers_stream_generator
```
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.jsonl)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.jsonl)。
## 指令集构建
@@ -40,7 +40,7 @@ pip install datasets==2.20.0
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 `AutoDL` 平台准备了 `Index-1.9B-Chat` 的环境镜像。点击下方链接并直接创建 `Autodl` 示例即可。
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/Index***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
@@ -33,7 +33,7 @@ MAX_JOBS=8 pip install flash-attn --no-build-isolation
> 考虑到部分同学配置环境可能会遇到一些问题,我们在 AutoDL 平台准备了 Phi-3 的环境镜像,该镜像适用于该仓库的所有部署环境。点击下方链接并直接创建 Autodl 示例即可。
> ***https://www.codewithgpu.com/i/datawhalechina/self-llm/Phi-3-Lora***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 模型下载
@@ -24,7 +24,7 @@
},
{
"cell_type": "code",
"execution_count": 3,
"execution_count": null,
"id": "e098d9eb",
"metadata": {
"tags": []
@@ -32,7 +32,7 @@
"outputs": [],
"source": [
"# 将JSON文件转换为CSV文件\n",
"df = pd.read_json('../dataset/huanhuan.json')\n",
"df = pd.read_json('../../dataset/huanhuan.json')\n",
"ds = Dataset.from_pandas(df)"
]
},
@@ -242,7 +242,7 @@
},
"outputs": [
{
"name": "stdin",
"name": "stdout",
"output_type": "stream",
"text": [
"The repository for /root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct contains custom code which must be executed to correctly load the model. You can inspect the repository content at https://hf.co//root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct.\n",
@@ -909,7 +909,7 @@
]
},
{
"name": "stdin",
"name": "stdout",
"output_type": "stream",
"text": [
"The repository for /root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct contains custom code which must be executed to correctly load the model. You can inspect the repository content at https://hf.co//root/autodl-tmp/LLM-Research/Phi-3-mini-4k-instruct.\n",
+1 -1
View File
@@ -37,7 +37,7 @@ pip install peft==0.11.1 # 用于 LoRA 微调
>考虑到部分同学配置环境可能会遇到一些问题,我们在AutoDL平台准备了Phi-4的环境镜像,点击下方链接并直接创建Autodl示例即可。 ***https://www.codewithgpu.com/i/datawhalechina/self-llm/self-llm-phi4***
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../dataset/huanhuan.json)。
在本节教程里,我们将微调数据集放置在根目录 [/dataset](../../dataset/huanhuan.json)。
## 模型下载