#dpo
GitHub Topic「dpo」がついているAI関連リポジトリの集計。Topicはリポジトリ作者が自己申告するメタタグで、AI関連の文脈で何が「dpo」と分類されているかを可視化します。
REPOS #dpo のRepo (TOP 3 / Stars降順)
A 1.32B-parameter Mixture-of-Experts LLM trained from scratch in PyTorch - custom tokenizer, MLA attention, 18B-token pretraining, SFT and DPO. No pretrained weights, no HuggingFace Trainer.
wane528/trace2trainLocal CLI to turn failed AI agent traces (wrong tool, bad args, over-refusals) from LangSmith/Langfuse into clean SFT/DPO fine-tuning data
kalyvask/self-improving-agentic-systemsA controller that learns how a tool-using agent should spend compute at each step (WIDER, DEEPER, DECOMPOSE, STOP, or ESCALATE to a stronger model) and improves its own policy from logged traces. Judged on cost per solved task with paired statistics; ships trained policies and an offline embed API (pip install, no key needed).
RELATED 他のTopicも見る · 全Topicランキング →
#claude-code
1,555#ai-agents
1,156#llm
1,066#claude
936#python
802#ai
737#developer-tools
723#mcp
719#codex
517集計対象: 各Repoの最新contentスナップショットの topics_json に小文字一致でマッチしたもの。 算出方法