ファインチューニングにおけるSFTデータの出所

背景

LMをファインチューニングするためのSFTデータソースは何がありますか？

1 オープンデータセット

代表例：

Stanford University Alpaca

https://raw.githubusercontent.com/tatsu-lab/stanford_alpaca/refs/heads/main/alpaca_data.json

Hugging Face datasets

https://huggingface.co/datasets

OpenAI OpenAssistant

https://github.com/LAION-AI/Open-Assistant/tree/main/oasst-data

2 LLMを用いた自動データ生成（最も一般的）

import openai
import json

prompt = "Generate 50 math reasoning QA pairs with step-by-step reasoning."

def generate_data(prompt):
	
    response = openai.chat.completions.create(
        model="gpt-4",
        messages=[{"role":"user","content":prompt}]
    )

    return response.choices[0].message.content

3 実際の対話をスクレイピング

ソース：

Reddit
StackOverflow
GitHub issues
Wikipedia

実ユーザーの質問は質が非常に高いです。

よってクローラーを作成する必要がありますが、ここでは提供しません。

4 プライベートデータベースの知識

企業のRAG知識ベース、ドキュメント、ウェブサイト

5 手動で作成した高品質データ

フォーマットは以下の記事を参照してください：「Fine-tuningにおける高品質SFTデータ構造設計」

https://strictfrog.com/ja/2026-03-15-%E9%AB%98%E5%93%81%E8%B3%AAsft%E3%83%87%E3%83%BC%E3%82%BF%E6%A7%8B%E9%80%A0%E8%A8%AD%E8%A8%88%E3%81%AE%E3%83%95%E3%82%A1%E3%82%A4%E3%83%B3%E3%83%81%E3%83%A5%E3%83%BC%E3%83%8B%E3%83%B3%E3%82%B0/

关于作者

我是Louis,一名长期从事iOS与AI相关工程实践的工程师,也是一个正在探索产品与商业可能性的准创始人.

这里的文章,更多是我在项目中用过,踩过坑,反复验证过的东西,而不是为了流量而写的“快内容”.

☕ 打赏

如果这篇文章对你有帮助,欢迎请我喝一杯咖啡☕️

PayPal
https://www.paypal.me/luochuan188

PayPay

You can support my work via PayPay by searching my PayPay ID:

PayPay ID: luochuan

微信支付

支付宝

你的支持会让我有更多时间,把真实项目中的经验持续整理和分享出来.

不打赏也完全没关系,感谢你读到这里.

联系与合作

如果你:

· 正在做iOS App / AI / 自动化相关的项目

· 对技术选型、架构设计、产品落地有困惑

· 或希望进行技术交流、合作探讨

欢迎通过以下邮箱联系我:

luochuanad@gmail.com

データソース分析

背景