build1 publisher
Nine models rewrote already-optimal code in all 45 trials of an EffiBench study
In a paper posted on 13 September, nine models across the Claude, GPT and Gemini families edited already-optimal EffiBench solutions in every trial. One added sentence in the prompt recovered 20 refusals.
Publishers:dev.to
Reality
- Evidence45
- Adoption18
- Hype gap+15
- Incentives35
- Confidence55