Active filters: rlhf
nvidia/Nemotron-RL-Ultra-Training-Blends
Viewer
• Updated • 54.2k • 1.36k
• 19
datapointai/text-to-speech-human-preferences-315k
Viewer
• Updated • 351k • 429
• 34
MMInstruction/VL-RewardBench
Viewer
• Updated • 1.25k • 336
• 16
hivamoh/cs217-rlhf-dataset
Viewer
• Updated • 1.2k • 17
• 1
InfoBayAI/Hindi-Non-STEM-QA-MCQ-Dataset
Viewer
• Updated • 50 • 25
• 1
rl-llm-wiki/knowledge-base
Viewer
• Updated • 386k • 7.53k
• 325
Preview
• Updated • 892
• 364
Viewer
• Updated • 81.4k • 5
• 30
Viewer
• Updated • 1.12M • 235
• 7
HuggingFaceH4/code_evaluation_prompts
Viewer
• Updated • 115 • 32
• 16
PKU-Alignment/PKU-SafeRLHF-10K
Viewer
• Updated • 10k • 1.55k
• 62
zetavg/ShareGPT-Processed
Viewer
• Updated • 90.7k • 165
• 30
Viewer
• Updated • 4.07M • 1.56k
• 18
luffycodes/Tutorbot-Spock-Bio-Dataset
Viewer
• Updated • 648 • 43
• 4
PKU-Alignment/PKU-SafeRLHF
Viewer
• Updated • 164k • 12.5k
• 196
PKU-Alignment/processed-hh-rlhf
Viewer
• Updated • 168k • 81
• 11
Preview
• Updated • 20
• 3
xzuyn/mmlu-auxilary-train-dpo
Viewer
• Updated • 101k • 83
• 2
ProlificAI/social-reasoning-rlhf
Viewer
• Updated • 3.82k • 175
• 54
efederici/alpaca-vs-alpaca-orpo-dpo
Viewer
• Updated • 49.2k • 111
• 7
Viewer
• Updated • 169k • 47
• 5
PKU-Alignment/PKU-SafeRLHF-30K
Viewer
• Updated • 29.9k • 1.31k
• 14
nlp-with-deeplearning/ko.SHP
Viewer
• Updated • 386k • 33
• 1
Viewer
• Updated • 1k • 30
AIffl/french_orca_dpo_pairs
Viewer
• Updated • 12.7k • 78
• 7
duxx/gutenberg-dpo-v0.1-tr
Viewer
• Updated • 918 • 17
• 2
duxx/distilabel-intel-orca-dpo-pairs-tr
Viewer
• Updated • 3.98k • 24
• 7
argilla/distilabel-capybara-dpo-7k-binarized
Viewer
• Updated • 7.56k • 21.8k
• 184
aari1995/ultradistil-intel-orca-dpo-de
Viewer
• Updated • 5.92k • 47
• 9