Reminded me Google's earlier paper, "Language Modeling Is Compression" https://arxiv.org/abs/2309.10668
Learning being a compression is also recently proposed as Gibbs compression proposition.
See Gibbs randomness-compression proposition https://arxiv.org/abs/2505.23869v5