Jezyk: remis, z lekkim wskazaniem na chinski
Na tym samym modelu i tej samej jakosci angielski i chinski daja praktycznie ten sam wynik karty.
Na sredni blad pomiaru chinski wypada lepiej w dwoch parach na trzy: D 2,91 wobec C 2,49
to jedyna para, w ktorej wygrywa angielski, a F 2,15 wobec E 3,65 i
B 7,67 wobec A 4,37 ida w przeciwne strony.
Chinski skraca opis z 25 823 znakow do 10 393, czyli do 40 procent, i nie gubi przy tym geometrii:
bramka parytetu przepuscila czternascie blokow na czternascie. Za to chinski na starszym modelu
(wariant B) wyprodukowal jedyny twardy blad w calej szostce.
Model: sunburst wygrywa wyraznie
Cztery obrazy z gpt-image-2.5-sunburst maja sredni blad od 2,15 do 3,65. Dwa obrazy
z gpt-image-2 maja 4,37 i 7,67. Sunburst jako jedyny potrafil doprowadzic belke do slupka miedzy
przeszkleniami i jako jedyny narysowal wyspe jako kostke widziana narozem, a nie jako fronton
zwrocony do kamery.
Na jakosci wysokiej sunburst jest przy tym ponad dwa razy szybszy i ponad dwa razy
tanszy: 36 sekund i 0,1135 USD wobec 92 sekund i 0,2367 USD.
Jakosc: maksymalna nie kupuje wiernosci
Po angielsku podniesienie jakosci z wysokiej na maksymalna pogorszylo sredni blad
z 2,49 na 3,65: cala prawa sciana wjechala o piec punktow w lewo. Po chinsku poprawilo z 2,91 na 2,15.
Karta w obu parach zmienila sie o najwyzej pol punktu, a w zadnej parze nie zmienila sie liczba
twardych bledow.
Maksymalna jakosc kosztuje przy tym dokladnie dwa razy wiecej i trwa dwa i pol raza
dluzej, bo mnozy tokeny wyjsciowe z 1372 na 5488. Na tej probie nie widac, zeby te pieniadze kupowaly
wiernosc rzutowi. Kupuja fakture materialow, a to jest ocena foundera, nie moja linijka.
Nowy kompozytor wobec starego
Szesc kadrow z nowego kompozytora ma razem jeden twardy blad klasy foundera.
Jeden kadr ze starego kompozytora, puszczony dzis na produkcji, ma ich piec naraz
i renderuje inne pomieszczenie.
Roznica w opisie: 25 823 znaki wobec 59 106. Dluzszy opis nie dal wiekszej kontroli, tylko
wiecej miejsca na sprzeczne zdania.
Zloty bieg wobec nowej szostki
Zloty bieg z 3 wrzesnia jest czysty pod wzgledem twardych bledow i founder ocenil go na 9,5.
Ale zmierzony linijka na rzucie ma najwiekszy sredni blad w calym zestawieniu, 10,55:
narozniki strefy na 64 zamiast 49,4, wyspa o 27 punktow w lewo, komoda z telewizorem o 16 punktow
w prawo.
To znaczy, ze zloty bieg byl dobrym obrazem wnetrza, ale slabym rysunkiem tego
konkretnego rzutu. Nowe warianty C, D, E i F sa blizej rzutu od niego o czynnik trzy do piec.
Blad wspolny wszystkim dziewieciu
W kazdym bez wyjatku obrazie wyspa jest w kadrze szersza, niz wynika z geometrii.
Prawda daje jej 31 punktow szerokosci, obrazy daja od 35 do 63. Nie jest to wiec wada jezyka,
modelu ani jakosci, tylko czegos, co siedzi w samym opisie wyspy albo w skali calej sceny.
Drugi wspolny grzech: komoda z telewizorem jest przesunieta w prawo w siedmiu
obrazach na dziewiec, srednio o szesc punktow. Tylko wariant D postawil ja za blisko lewej krawedzi.
Trzy liczby, ktore da sie policzyc bez zadnej oceny, i jedna
kolumna, ktorej bez pomiaru nie da sie wypelnic. Kazda para to ten sam opis i ten sam model, rozni je
tylko ustawienie jakosci.
Czego ten test NIE rozstrzyga
Jedno wywolanie na wariant. Model obrazu jest losowy. Ta sama komenda puszczona
drugi raz da inny kadr. Roznice rzedu jednego, dwoch punktow procentowych miedzy wariantami leza
w granicach szumu jednego losowania i nie dowodza niczego.
Roznica miedzy C a F to 0,34 punktu. Tego nie da sie obronic na probie n rowne
jeden. Co da sie obronic: sunburst wobec gpt-image-2 (roznica 2 do 5 punktow, na czterech obrazach
wobec dwoch) oraz nowy kompozytor wobec starego (jeden twardy blad wobec pieciu).
Ocena kadru to nie jest ocena zdjecia. Mierzylem wiernosc rzutowi. Nie mierzylem
tego, czy kadr dobrze sprzedaje dom, czy swiatlo jest wiarygodne ani czy klient go polubi.
Ta ocena nalezy do foundera i nie jest niczym zwiazana z liczbami powyzej.
Karta dziesieciu pytan byla pisana pod zloty bieg. Dwa jej pytania trzeba bylo
zinterpretowac, zeby w ogole dalo sie ja zalozyc na kadry bez schodow. Interpretacja jest opisana
wyzej i mozna ja odrzucic.