Models are likely already doing this inside AI labs because it can be hundreds of millions of dollars for every percentage point increase in hardware inference efficiency.