Fine-tuning之SFT数据来源

背景

用于微调LM的SFT数据来源有哪些?

1 开源数据集

常见：

Stanford University Alpaca

https://raw.githubusercontent.com/tatsu-lab/stanford_alpaca/refs/heads/main/alpaca_data.json

Hugging Face datasets

https://huggingface.co/datasets

OpenAI OpenAssistant

https://github.com/LAION-AI/Open-Assistant/tree/main/oasst-data

2 用 LLM 自动生成数据（最常见）

import openai
import json

prompt = "Generate 50 math reasoning QA pairs with step-by-step reasoning."

def generate_data(prompt):
	
    response = openai.chat.completions.create(
        model="gpt-4",
        messages=[{"role":"user","content":prompt}]
    )

    return response.choices[0].message.content

3 爬取真实对话

来源：

Reddit
StackOverflow
GitHub issues
Wikipedia

真实用户问题质量很高。

所以需要需要写爬虫了,这里就不提供了.

4 私有数据库知识

企业RAG知识库, 文档, 网站

5 人工编写高质量数据

格式请参照下面这篇文章: “Fine-tuning之高质量SFT数据结构设计”

https://strictfrog.com/2026/03/15/Fine-tuning%E4%B9%8B%E9%AB%98%E8%B4%A8%E9%87%8FSFT%E6%95%B0%E6%8D%AE%E7%BB%93%E6%9E%84%E8%AE%BE%E8%AE%A1/

关于作者

我是Louis,一名长期从事iOS与AI相关工程实践的工程师,也是一个正在探索产品与商业可能性的准创始人.

这里的文章,更多是我在项目中用过,踩过坑,反复验证过的东西,而不是为了流量而写的“快内容”.

☕ 打赏

如果这篇文章对你有帮助,欢迎请我喝一杯咖啡☕️

PayPal
https://www.paypal.me/luochuan188

PayPay

You can support my work via PayPay by searching my PayPay ID:

PayPay ID: luochuan

微信支付

支付宝

你的支持会让我有更多时间,把真实项目中的经验持续整理和分享出来.

不打赏也完全没关系,感谢你读到这里.

联系与合作

如果你:

· 正在做iOS App / AI / 自动化相关的项目

· 对技术选型、架构设计、产品落地有困惑

· 或希望进行技术交流、合作探讨

欢迎通过以下邮箱联系我:

luochuanad@gmail.com

数据来源分析

背景