logoalt Hacker News

nostreboredyesterday at 6:08 PM0 repliesview on HN

Yes, for vision classifiers we have in prod, I've seen a huge difference between A, B, C, 1, 2, 3 style answers and emitting a string. Even from just base model behavior pre-sft/rl. It was one of those obvious in retrospect moments.