$ ls ./blog/laaj

LLM-as-a-Judge w praktyce

Od pytania „czy model odpowiada dobrze" do pipeline'u, w którym dwa agenty piszą kod, sędzia z innego modelu wybiera, a ja liczę, ile decyzji po drodze nie podjął nikt.

Seria o jednym pytaniu: czy można pozwolić modelowi decydować. Zaczyna się od tego, jak w ogóle mierzyć odpowiedzi LLM-a, potem daje sędziemu władzę nad kodem dwóch agentów, a od trzeciej części każdy wpis jest eksperymentem z liczbami: przewidywania zapisane przed startem, rejestr przebiegów, wynik, także wtedy, gdy przewidywanie padło.

Czytać po kolei. Każda część zakłada poprzednią, a pipeline, na którym to wszystko chodzi, rośnie z wpisu na wpis.

$ series laaj
4 części
↑