OpenAI research scientist Noam Brown discusses how traditional AI benchmarks are failing to accurately evaluate modern models due to their increasing reliance on large-scale test-time compute. He argues that model capabilities are now a fun…
Firehose
Filtered to Podcasts, tagged “Test-time compute” · clear filters
Browse: People · Companies · Papers · Podcasts · Hacker News