AI_zero

AI_zero är en datorstyrd spelare för Svenskt Bräde. Den har lärt sig spelet genom att spela stora mängder partier mot sig själv.

Det finns flera nivåer av AI_zero. Välj Pro 2 om du vill möta den starkaste och mest eftertänksamma versionen, Pro om du vill ha en snabb men mycket stark motståndare, och Strong eller Medium om du vill ha ett mer lättillgängligt spel.

Vill du veta mer om hur AI_zero skapades, hur den utvärderas och hur de historiska versionerna skiljer sig åt finns mer bakgrund längre ner på sidan: bakgrund och versionshistorik.

Nivåer

Nivå Passar för Hur den spelar
Pro 2 Dig som vill ha den starkaste AI_zero-motståndaren. Bygger på Pro, men söker två steg framåt och använder molnberäkning för att hinna värdera fler fortsättningar.
Pro Dig som vill möta en mycket stark och snabb spelare. Använder det starkaste neurala nätet lokalt och gör en beskuren 1-ply-sökning innan den väljer flytt.
Strong Dig som vill ha bra motstånd utan full Pro-styrka. Använder samma tränade grundvärdering som Pro, men med enklare flyttval och lite mer variation.
Medium Dig som vill ha ett mer avslappnat eller tränande parti. Väljer flytt mer direkt från brädvärderingen och har mer variation än Strong.

Bakgrund

I början av 1990-talet skapade Gerald Tesauro TD-Gammon, en datorbaserad agent för backgammon baserad på ett artificiellt neuralt nätverk och reinforcement learning. TD-Gammon var banbrytande dels i hur den togs fram, men även genom att den uppnådde nivåer i sitt spel som utmanade de bästa mänskliga backgammonspelarna.

AI_zero är en datorbaserad spelare för Svenskt Bräde, skapad med samma metodik som användes för att skapa TD-Gammon vilken också låg till grund för metodiken som användes för att ta fram AlphaGoZero. "Zero" anspelar på att metodiken inte är beroende av, eller bygger på, någon mänsklig expertis.

AI_zero har lärt sig hitta framgångsrika strategier genom att spela mot sig själv. I senare versioner har AI_zero även tränats genom att fiktivt återspela matcher som spelats mellan människor online, i syfte att utsätta det neurala nätet för situationer som det inte så ofta hamnar i genom spel mot sig själv. Det är dock inte så att valen som görs av spelare ligger till grund för dess bedömning av vad som är en bättre eller sämre flytt.

Utvärderingen av AI_zeros spelförmåga sker genom spel mot BrädeAI, den enda tidigare kända datorbaserade agenten för Svenskt Bräde, samt spel mot mänskliga spelare online. Nedan visas en översikt över de versioner av AI_zero som hittills varit tillgängliga för spel. När en version av AI_zero spelar online lär den sig inte av ytterligare spel.

Det är inte självklart vilket kriterium som bör användas för att utvärdera vilken AI som är bättre eller sämre än en annan. Tittar man på matcher om endast ett parti är det naturligt att titta på hur stor andel av partierna som vinns respektive förloras, men vill man ha en AI med bra förmåga att vinna matcher med flera partier så blir det relevant att väga in hur många poäng som vinns respektive förloras i varje parti.

En annan försvårande omständighet är att många spel mot AI_zero inte avslutas. Av denna anledning visas i tabellen även estimerade siffror där avbrutna partier inkluderats. Dessa siffror baseras på AI:ns uppskattade värdering av spelläget.


Versionshistorik

AI version Beskrivning NN-noder
(in/gömda/ut)
Flytt-policy Andel vinster mot BrädeAI
(av 1000)
Andel vinster Fiktiv rating Snitt-
poäng
Aktiv online
0.26 Som 0.25, men söker två steg framåt (med dynamisk beskärning för att minska respons-tiden). Använder parallell sökning på många maskiner i molnet. 218/120/12 Dynamically pruned 2-ply N/A 65%
av 243
1769 0.79 2026-06-16
-
0.25 Som 0.23 upp till 200k tränade partier, därefter 0.001 learning rate till 450k partier. 218/120/12 Pruned 1-ply 92.8% 60% (61%)
av 45052 (51190)
1760 (1760) 0.49 (0.51) 2023-10-05
-
0.24 Som 0.23, men med fortsatt träning till 394000 matcher. 0.24 vinner 513 av 1000 matcher more 0.23, med en ppg om 0.095. Trots detta verkar 0.23 prestera bättre på sweboard. 218/120/12 Pruned 1-ply 93.1% 48% (55%)
av 162 (222)
1537 (1647) -0.13 (0.10) 2023-09-23
-
2023-10-04
0.23 Baserad på 0.22, men med fortsatt träning med lägre (0.01) learning rate. 218/120/12 Pruned 1-ply 92.2% 56% (62%)
av 260 (382)
1686 (1812) 0.21 (0.36) 2023-09-09
-
2023-09-22
0.22 Som 0.21, men med nätsymmetri mellan vit&svart, samt viktuppdatering efter avslutat parti (inte efter varje drag) 218/120/12 Pruned 1-ply 91.3% 56% (63%)
av 391 (559)
1703 (1858) 0.32 (0.45) 2023-08-12
-
2023-09-08
0.21 Samma struktur som 0.20, men med 241000 tränade matcher. Bättre ppg mot brädeAI 218/120/12 Pruned 1-ply 89.5% 48% (59%)
av 331 (552)
1563 (1779) -0.13 (0.16) 2023-07-17
-
2023-08-11
0.20 Samma struktur som 0.19 men med 40% två-stegs TD för stabilitet i träningen. 130 000 tränade matcher 218/120/12 Pruned 1-ply 89.9% 48% (57%)
av 556 (993)
1579 (1789) -0.15 (0.19) 2023-06-11
-
2023-07-16
0.19 Samma struktur som 0.18 men annat antal tränings-matcher. 218/120/12 Pruned 1-ply 90.1% 33% (40%)
av 15 (20)
1478 (1493) -1.00 (-0.75) 2023-06-10
-
2023-06-10
0.18 12 utnoder som representerar varje möjligt utfall (6 vinstsätt för resp. spelare). 218/120/12 Pruned 1-ply 90.3% 42% (48%)
av 67 (89)
1497 (1552) -0.66 (-0.44) 2023-06-05
-
2023-06-09
0.17 Som 0.16, men nätet som byts till är tränat enbart för jan-spel. 218/80/1 Pruned 1-ply ? 48% (59%)
av 432 (807)
1572 (1762) -0.33 (0.08) 2023-05-03
-
2023-06-04
0.16 Byt till alternativt nät när jan-läge uppstår (5 band i rad). Detta nät var dock ej bra... 218/80/1 Pruned 1-ply ? 44% (62%)
av 120 (251)
1492 (1750) -0.97 (-0.11) 2023-04-26
-
2023-05-02
0.15 Återspela Jan-matcher från Sweboard, med högre lambda (0.9 vs. 0.7). 218/80/1 Pruned 1-ply 90.7% 55% (67%)
av 2231 (4144)
1692 (1855) -0.40 (0.09) 2022-11-07
-
2023-04-25
0.14 återspela Jan-matcher från Sweboard. 218/80/1 Pruned 1-ply 91.6% 42% (60%)
av 106 (208)
1481 (1711) -0.88 (-0.24) 2022-10-31
-
2022-11-07
0.13 Begränsa 1-ply look-ahead till de 5 bäst rankade flytten (direkt ranking). Ger snabbare flytt utan märkbart försämrad spelstyrka. 218/80/1 Pruned 1-ply 89.9% 49% (61%)
av 1112 (1763)
1554 (1884) -0.63 (-0.20) 2022-08-06
-
2022-10-30
0.12 Flytt-policy baserat på utvärdering efter motståndarens möjliga drag i följande flytt 218/80/1 1-ply look-ahead 89.8% 48% (57%)
av 220 (299)
1559 (1696) -0.92 (-0.52) 2022-07-24
-
2022-08-05
0.11 In-noder för vackert spel och antal band i följd. 218/80/1 Direkt från NN 86.4% 67% (61%)
av 15 (28)
1562 (1582) 0.47 (0.28) 2022-07-23
-
2022-07-23
0.10 Replika av TD-gammon, med anpassning till flera vinstsätt. 168/80/1 Direkt från NN 85.0% 45% (48%)
av 165 (179)
1527 (1557) -0.73 (-0.65) 2022-07-13
-
2022-07-22