Trumpas atsakymas: CLM-8B yra atviras kontrastinės kalbos modelis, skirtas greitiems agentų sprendimams, kurio autoriai teigia apie iki maždaug 9 kartų mažesnį delsos laiką nei „Jev“ klasės analogų. Šie skaičiai lieka nepatvirtinti už išleidimo konfigūracijos ribų. Jei kuriate kodavimo agentus, prieš pasitikėdami diagramomis, atlikite A/B testą patys.
Svarbiausios išvados:
Vėlavimo teiginiai: ~9× Jev pagreitį traktuokite kaip autoriaus nurodytą, kol kiti jo neatkurs.
„Eval“ pakinktai: Atliekant A/B testavimą CLM-8B, laikykite įrankius ir raginimus fiksuotus.
Hibridinis stekas: karštiems ciklams naudokite CLM; naujoms užduotims palikite lėtesnį samprotavimo įrankį.
Atviri svoriai: prieš siunčiant komercinius šakutes, patikrinkite „Apache“ licencijos failus.
Piktnaudžiavimo rizika: Įtraukite grįžtamuosius įrankius ir paslaptis, kai agentai nusprendžia per milisekundes.
Kuo CLM-8B bando būti ⚡
Kontrastinio kalbos modelio mokymas, kaip apibūdina šį kritimą propaguojantys asmenys, yra susijęs su būsenų ir veiksmų susiejimu, o ne su kito žetono tikimybės maksimalizavimu atskirai. Aiškiai tariant: modelis yra stumiamas taip, kad „čia yra situacija“ būtų susieta su „čia yra žingsnis“, labiau kaip politikos vadovas nei romanistas. Tai yra I sistemos analogija, kurios tyrėjai nuolat siekia – greita, asociatyvi, sprendimu pagrįsta – priešingai nei II sistemos ilga minčių grandinė, kuri degina žetonus, mąstydama garsiai.
CLM-8B yra pirmasis viešas svorio nustatymas šioje linijoje. Jis pozicionuojamas kaip atviras tyrimų leidimas su „Apache 2.0“ licencija , skirta pranešimams, lydėjusiems kritimą, o tai svarbu, jei norite tiksliai suderinti, išsiųsti ar kitaip išplėsti versiją be teisininkų pikniko. Jacky Kwok pristatė darbą; Azalia Mirhoseini, kuri yra Stanfordo universiteto narė, jį išplėtojo; o platesnis kontekstas vaizduoja su Stanfordo ir NVIDIA susijusias komandos pastangas. Įvardyti tyrėjai, vieši svorio svoriai, atviras kodas – ne anoniminė informacija apie nutekėjimą. Trečiųjų šalių replikacijai dar per anksti, todėl skepticizmo diapazoną išlaikykite kažkur tarp „įdomu“ ir „parodykite man nepriklausomą valdybą“.
Dydžio klasė yra aštuoni milijardai parametrų, o tai pakankamai maža, kad laboratorijos ir nepriklausomi kūrėjai galėtų ją talpinti neparduodami nė vieno procesoriaus 100 valandų per parą. Jau kalbama apie didesnį CLM-35B tęsinį. Ar didesnis brolis išlaikys delsos istoriją, ar keis greitį į gylį, lieka neaišku, tačiau planas aiškus: tai skirta būti šeimos, o ne vienkartine demonstracine kortele.
- Dėmesys: būsena → veiksmų ciklai agentams, o ne rašinių rašymas
- Licencijavimas, apibūdinamas kaip „Apache 2.0“ išleidimo metu
- Stilius: 1 sistema / į sprendimus orientuota mokymo istorija
- Tęsinys: plane minimas didesnis CLM-35B
1 sistemos stilius, palyginti su įprastu žetoniniu bėgimo takeliu
Dauguma jums žinomų gamybinių LLM programų generuoja tekstą po vieną žetoną. Tai puikiai tinka prozai, kodo išklotoms ir kruopštiems samprotavimo pėdsakams. Štai kodėl agentas, kuriam reikia dvidešimt mikrosprendimų per minutę, gali jaustis vangus, net kai modelis yra „protingas“. Kiekvienas žingsnis apmoka autoregresinį mokestį.
Kontrastinio kalbos modelio idėja perkelia akcentus. Užuot prašę tinklo nupasakoti savo kelią į atsakymą, jūs jį mokote rinktis teisingą veiksmą, atsižvelgiant į būseną – įsivaizduokite kontrastingus gerų ir blogų veiksmų palyginimus, o ne tiesiog sklandų tęsinį. Modelių kūrėjai jau žino šį modelį: kartais nereikia tūkstančio žodžių pagrindimo; reikia, kad modelis įvestų pytest, o ne rm -rf. Greitieji ciklai atsižvelgia į šį skirtumą.
Tai nereiškia, kad CLM-8B negali skleisti teksto. Tai reiškia, kad mokymo tikslas ir vertinimo istorija yra linkę į agentinę kontrolę. Tai kitokia produkto forma nei „pokalbių modelis, kuris taip pat gali iškviesti įrankius“. Ši pramonės šaka daugelį metų tobulino modelius, kad jie geriau kalbėtų apie įrankius, tačiau vis tiek trukdė pačiam kalbėjimui. Sprendimais grindžiamas modelis – tai toks žingsnis į šoną, kuris arba atrodo akivaizdus atgaline data, arba žlunga, kai lyginamieji standartai susipainioja. Galimi abu rezultatai.
Teigiamas greitis ir bandymų rezultatai (traktuoti kaip teiginius)
Štai kas lemia socialinių tinklų įrašus: reklamuotojai teigia, kad išvados atliekamos iki maždaug 9 kartų greičiau nei „Jev“ klasės modeliai. Po nedidelio tikslinimo jie taip pat praneša apie stiprius agentinio kodavimo rezultatus – „DeepSWE“ sėkmė siekia apie 81,6 %, o „Terminal-Bench 2.1“ – apie 87,6 %. Kai kuriuose vertinimuose jie apibūdina „zero-shot“ našumą kaip panašų į „Jev“, o delsa išlieka daug mažesnė. Vienoje klasterio santraukoje, kurioje buvo pateiktas pranešimas apie išleidimą, buvo nurodytas maždaug 32 ms klasės atsako laikas terminalo testo nustatymuose. Atidžiai suformuluokite tai: pranešta ir teigiama, šiame straipsnyje nepriklausomai neaudituota.
Jei šie delsos skaičiai apibendrinami, praktinė nauda yra mažiau GPU vienam lygiagrečiam agentui arba daugiau agentų vienam GPU. Kodavimo agentai, kurie apdoroja apvalkalą, yra ypač jautrūs, nes sieniniai laikrodžiai laukimo metu veikia kaip skirtingi produktai; 200 ms sprendimas ir 30 ms sprendimas po kelių šimtų ėjimų atrodo kaip skirtingi produktai. Vartotojai dažnai kaltina „modelio kvailumą“, kai didesnis trūkumas yra interaktyvus delsimas.
Vis dėlto – ir tai yra pastraipa apie suaugusiųjų priežiūrą – autorių stendai reklamuojasi tol, kol kažkas kitas jų neatkuria bendrai naudojama įranga su bendromis užduotimis. Nedideli tikslinimo rezultatai taip pat gali paslėpti daug pastolių. Stiprūs „DeepSWE“ ir „Terminal-Bench“ skaičiai yra įdomūs būtent todėl, kad šie rinkiniai baudžia trapius agentus, bet įdomybė nėra replikacija. Ant 9× ir 32 ms klasės skaičiaus pasilikite lipduką su užrašu CLAIM.
Palyginimo lentelė: Žetonų po žetono LLM ir CLM stiliaus rėminimas
Lentelės padeda, kai rinkodaros kalba tampa neaiški. Šioje lentelėje palyginami tipiniai LLM generavimo įpročiai su tyrėjų aprašytu kontrastinio kalbos modelio modeliu. Langeliai yra šiek tiek nelygūs, nes konkretūs palyginimai visada tokie yra.
| Kampas | Tipinė LLM (žetonas po žetono) | CLM stiliaus / 1 sistemos kadravimas | Kodėl tai svarbu agentams |
|---|---|---|---|
| Pirminė kilpa | Numatyti kitą žetoną, dažnai su ilgais pėdsakais | Susieti būseną su veiksmu; kontrastinis sprendimų šališkumas | Mažiau iššvaistomų žetonų tarp įrankių iškvietimų (teoriškai) |
| Vėlavimo pojūtis | Gali jaustis lėtai plepėdamas, kai kontroliuojamas daugiapakopis režimas | Autoriai teigia, kad delsa yra daug mažesnė, palyginti su „Jev“ klase | Interaktyvūs kodavimo agentai nekenčia laukimo laiko |
| Jėgos zona | Proza, esė planavimas, platus pokalbis | Greita būsena → veiksmas – paryškintas agentinis kodavimas | Kitoks darbas, ne visada pakaitalas |
| Pranešti skaičiai | Priklauso nuo modelio; čia nėra vieno skaičiaus | Iki ~9 kartų greitesnis (teigiama); „DeepSWE“ ~81,6 %; „Terminal-Bench 2.1“ ~87,6 % po trumpo darbo krūvio (teigiama) | Pažadu, jei trečiosios šalys patvirtins – didelis, jei |
| Atvirumas | Uždarų API ir atvirų svorių derinys | Atviri svoriai/kodas, įrėminti „Apache 2.0“ aplinkoje | Tiksliai suderinkite ir organizuokite renginį neatspėdami terminų |
| Pagauk / keistenybė | Protingas, bet kartais pasakoja amžinai 🐢 | Dar per anksti; laukiama nepriklausomų pakartojimų | Nestatykite įmonės ant vienos spaudos diagramos |
Naudokite lentelę kaip mentalinį modelį, o ne verdiktą. Produktų komandos vis tiek turi įvertinti savo pačių galimybes: įrankių schemos, pakartotinio bandymo politika ir aplinkos triukšmas pakeis rezultatus labiau, nei leidžia skaidrių rinkinys.
Kas slypi už triukšmo 👤
Priskyrimas yra svarbus, nes atviri dirbtinio intelekto leidimai yra įvairūs – nuo atsarginių laboratorinių tyrimų rezultatų iki paslaptingų torentų. Šis turi veidus. Jacky Kwok pristatė CLM; Azalia Mirhoseini padėjo jį išplėsti; nušvietimas nuosekliai įrėmina Stanfordo ir NVIDIA susijusį mokslinių tyrimų bendradarbiavimą. Tai stebuklingai nepadaro kiekvieno skaičiaus teisingu, bet suteikia reputacijai pranašumą. Įvardyto tyrėjo atviri leidimai paprastai yra greičiau testuojami nei anoniminiai leidimai – kolegos mėgsta viešą taikinį.
Kūrėjams praktinė nauda yra prieiga. Atviri svoriai ir „Apache 2.0“ stiliaus licencija (kaip buvo aptarta paleidimo metu) paprastai reiškia, kad galite komerciškai eksperimentuoti su mažiau kliūčių nei su licencijomis, skirtomis tik tyrimams. Prieš ką nors išsiųsdami, patys patikrinkite faktinius licencijos failus leidime; aprėpties santraukos nėra sutartis. Tai gali skambėti pedantiškai, tačiau licencijų pedantiškumas gelbsti startuolius.
Socialinio amplifikavimo modelis mums pažįstamas: tyrėjo įrašas, gerbiamų stiprintuvų citatų įrašai, tada „agentų pagaliau išspręsta“ banga. Filtruokite žmones, kurie dalijasi sujungimo detalėmis. Vieno sėkmingo programavimo paleidimo ekrano nuotraukos yra nuotaikų teatras, o ne mokslas. 🛰️
Kodėl „State-to-Action“ ciklai turi savo agentinį kodavimą
Agentinis kodavimas yra žiauri aplinka. Modelis mato saugyklos momentinę kopiją, apvalkalo transkripciją, galbūt nepavykusį testą ir turi pasirinkti redagavimą arba komandą. Sėkmė dažniau būna dvejetainė nei pokalbis. Arba testas tampa žalias, arba ne. Tokia atlygio forma palankiau politikams, kurios aiškiai pasirenka veiksmus, o ne modeliams, kurie rašo gražius nesėkmių aprašymus.
Kontrastingos mokymo istorijos tinka šiam pasauliui, nes jos aiškiai stumia tinklą link pageidaujamų veiksmų esant tam tikrai būsenai. Įsivaizduokite tai kaip jaunesniojo inžinieriaus mokymą „kai pamatysite šią klaidos klasę, griebkitės šio taisymo šablono“, o ne „parašykite tinklaraščio įrašą apie tai, kodėl kompiliatoriai yra sudėtingi“. Jaunesniajam inžinieriui vis tiek reikia nuovokos; trumpesnis kelias tik sumažina dvejones.
Čia vėlavimas sutampa. Tarkime, agentas vidutiniškai atlieka aštuoniasdešimt įrankio žingsnių, kad ištaisytų vidutinio dydžio klaidą. Sutrumpinkite laiką 150 ms per žingsnį ir atgausite dvylika sekundžių sieninio laikrodžio – tai yra skirtumas tarp srauto būsenos ir vartotojo, kuris tikrina el. paštą paspausdamas Alt Tab klavišą. Komandos, valdančios agentų parkus, tą pačią matematiką jaučia ir debesijos sąskaitose. Teigiamas dydžio eilės išvadų pagreitis, palyginti su „Jev“ klasės serveriu, net jei realiai jis yra „tik“ 4 kartus greitesnis, vis tiek pertvarko pajėgumų planavimą.
Yra viena netvirta metafora, kurią nuolat vartoju susitikimuose: pokalbių modeliai, kuriuose po vieną žetoną aptarinėjama, yra tarsi maršruto aptarimas kiekvienoje sankryžoje, o „System 1“ stiliaus valdiklis labiau primena raumenų atmintį vairavimui mieste. Raumenų atmintis sugenda naujame mieste. Taip pat ir siaurai suderintas veiksmų modelis, kai saugyklų kultūra yra savita. Vis tiek reikia svarstymo režimų naujiems architektūros pasirinkimams; reikia refleksų penkiasdešimtajam „pataisyti importavimą ir paleisti iš naujo“. Hibridiniai stekai – greitas CLM tipo valdiklis ir sunkesnis samprotavimo įrankis kietose atšakose – tikriausiai yra ta vieta, kur randasi rimtos sistemos, net jei paleidimo postuose parduodamas vienas herojaus modelis. 🚦
Taip pat verta garsiai pasakyti: agentinio kodavimo suolai, tokie kaip „DeepSWE“ ir „Terminal-Bench“, apdovanoja už pastolius. Įrankių naudojimo kokybė, leidžiamųjų įrankių sąrašai ir atkūrimo raginimai gali dviženkliu skaičiumi padidinti sėkmės rodiklius. Kai po nedidelio patikslinimo matote ~81,6 % arba ~87,6 %, pasidomėkite, kokia danga buvo už svorių. Tai ne šešėlis; taip veikia ši sritis.
Atviri svoriai, tikslus reguliavimas ir 35B šešėlis
Atviri svoriai keičia teiginio socialinę dinamiką. Uždari API modeliai gali mirksėti diagramoje ir palikti jus spėlioti apie užterštumą, dekodavimo gudrybes ar slaptus sistemos raginimus. Naudodami atsisiunčiamus parametrus galite bent jau baksnoti. CLM-8B tikslus derinimas jūsų vidinei kodavimo aplinkai – jūsų plėtros taisyklėms, diegimo CLI, jūsų monorepo topologijai – yra realus kelias į spindinčius darbo numerių skaičius, o ne nulinio smūgio magija pirmą dieną.
„Apache 2.0“ formatavimas (pagal aprašą) yra patogus kūrėjams: patentų suteikimo kalba, aiškios perskirstymo normos, mažiau „tik tyrimų“ spąstų. Dar kartą: perskaitykite failus. Aprašų autoriai apibendrina; teisininkai specializuojasi.
Planuojamas CLM-35B yra dramblys plano skaidrėse. Didesni modeliai dažnai atgauna svarstymo įgūdžius ir praranda dalį „mažo ir žiauriai greito“ žavesio, nebent distiliavimas ar spekuliatyvūs triukai kontroliuoja delsą. Jei aštuonių milijardų variantas yra sportinis automobilis, o trisdešimt penkių milijardų – turistinis sedanas, komandos gali pasilikti abu: 8B – karštiesiems ciklams, 35B – griežtam planavimui. Arba didesnis modelis gali tiesiog dominuoti, jei įranga ir toliau pigs. Kuri ateitis ateis, dar neaišku; tai nuspręs ateities išleidimo pastabos, o ne ši pastraipa.
Viena subtili atvirojo agento modelių rizika: žmonės juos įjungs į CI be greičio apribojimų ir greitai aptiks injekciją per kenkėjiškus README failus. Greitieji modeliai sustiprina netinkamą naudojimą taip pat, kaip ir praktinę vertę. Apsauginiai turėklai nėra pasirinktinis kostiumas; jie yra produktas.
- Prieš vertindami kokybę, tiksliai suderinkite savo pėdsakus
- Lėtesnį samprotavimo mechanizmą naudokite kaip avarinį liuką naujoms užduotims
- Instrumento delsa p50/p95 jūsų diržuose, ne tik tikslumas
- Tarkime, kad 35B vėl pakeis Pareto ribą
Jevo palyginimo skaitymas be sniego
Palyginimai su Jev klasės modeliais atlieka retorinį darbą. Jie sukuria lygiavertį agento greičio lygmenyje, todėl „iki 9 kartų greitesnis“ turi referentą. Santykiniams teiginiams reikia inkaro, ir tai yra pagrįsta. Pavojus yra tas, kad visas vertinimo paketas sugrius į vieną daugiklį. Paketo dydis, tikslumas, dekodavimo nustatymai, konteksto ilgis ir įrankio iškvietimo serializavimas keičia tai, ką reiškia „greitesnis“, ir šie rankenėlės retai pasirodo toje pačioje skaidrėje.
Kai klasterio santraukoje terminalo bandymų aplinkoje nurodomi ~32 ms klasės atsakymai, „atsakymas“ traktuojamas kaip dviprasmiška etiketė, kol kas nors nepaaiškins, ar tai reiškia pirmąjį prieigos raktą, viso veiksmo JSON, ar talpykloje esantį prefiksą. Šie skirtumai rinkodaros milisekundes paverčia inžinerijos valandomis. Panaši „zero-shot“ kokybė su mažesne delsa yra svajonių derinys; jei nepriklausomos grupės patvirtina bent pusę šios svajonės, CLM stiliaus mokymai užsitarnauja nuolatinę vietą architektūros susitikimuose.
Iki tol Jevą traktuokite labiau kaip konkurencijos naratyvą, o ne kaip nusistovėjusią lyderių lentelę. Konkurencija parduoda įrašus. Jūsų produkcijos KPI nerūpi naratyvas. Matuokite užduoties sėkmę, kiekvieno išspręsto bilieto kainą ir žmogaus įsikišimo rodiklį. Jei kontrastinės kalbos modelio atšaka laimi šiuose dalykuose, švęskite. Jei ji laimi tik „Twitter“, tęskite savo veiklą. 🚶
Nedidelis prieštaravimas: varžybų naratyvai vis dar turi įtakos. Jie verčia laboratorijas skelbti skaičius, o ne nuotaiką. Tik nepainiokite rezultatų su sportu.
Ko reikia, kad šis leidimas būtų sėkmingas
Kad CLM-8B būtų svarbus ir po naujienų ciklo, turi įvykti keli dalykai:
- Replikacija: išorinės grupės turėtų sugebėti suderinti antraštės delsą ir kodavimo sėkmės rodiklius su dokumentuotais receptais.
- Išnaudokite skaidrumą: bendrinkite agento apvalkalo informaciją, kuri davė „DeepSWE“ ir „Terminal-Bench“ balus.
- Dokumentai, kuriuose nedaroma prielaida apie laboratorinę telepatiją: aiškūs tikslinimo scenarijai, „eval“ komandos ir techninės įrangos pastabos.
- Gedimų režimai: parodo, kur neveikia 1 sistemos stiliaus sprendimai – naujos API sąsajos, dviprasmiški bilietai, su saugumu susijusios operacijos.
- Atnaujinimo kelias: paaiškinkite, kaip CLM-35B yra susijęs, kad komandos neperkrautų savo 8B paketo iki aklavietės.
Jei tos angos lieka tuščios, modelis tampa dar vienu įdomiu prespapjė. Jei jos užsipildo, agentų platformos gauna konkretų komponentų pasirinkimą: svarstymo teisės magistro (LLM) modelį intensyviam apmąstymui, kontrastinį greitąjį modelį – trūkčiojančioms rankoms. Toks darbo pasidalijimas atrodo brandesnis nei apsimetinėjimas, kad vienas megamodelis turėtų atlikti kiekvieną darbą esant bet kokiam delsos biudžetui.
Praktiniai patarimai statybininkams, kurie siunčia agentus
Jums nereikės rytoj perrašyti savo steko. Jums reikia plano, kaip įvertinti sprendimus priimančius modelius. Pradėkite nuo delsos požiūriu kritinės savo agento dalies – galbūt terminalo mikrociklo arba „pasirinkite kitą grep“ veiksmo – ir atlikite CLM-8B tikslų derinimą su dabartiniu darbiniu arkliuku. Laikykite sujungimą pastovų. Viską užregistruokite.
Stebėkite tylios kokybės regresijas: modeliai, kurie akimirksniu atsako užtikrintai atlikdami neteisingus veiksmus, yra blogesni nei lėtai teisingi modeliai didelės rizikos saugyklose. Pridėkite patvirtinimo veiksmus. Pirmenybę teikite grįžtamiesiems įrankiams. Numatykite antrą modelio iškvietimą, kai patikimumas mažas – taip, tai sumažina dalį greičio laimėjimo, ir tai gerai. Greitis be stabdžių yra tai, kaip demonstracinės versijos tampa sutrikimais.
Organizacijos pusėje atnaujinkite pajėgumų lapus stulpeliu „veiksmai per sekundę vienam GPU“, o ne tik žetonai per sekundę. Agentų darbo krūviams rūpi sprendimai, o ne poezijos našumas. Jei autorių teiginys apie ~9× bent iš dalies išliks po kontakto su jūsų aparatine įranga, jūsų skaičiuoklė atrodys kitaip. Jei ne, išmokote pigiai.
Ir prašau, dėl operacijų vadovo meilės, neklijuokite gamybos paslapčių į eksperimentinį agentą vien todėl, kad modelis atrodė „saugus“. Greitai atidaromi modeliai palengvina šešėlinių sistemų, kurių niekas neperžiūri, kūrimą. Procesas vis tiek svarbus.
Atidarytos temos vis dar kabo
Kelios neišspręstos temos neleidžia man visiškai reklamuotis:
- Kiek praneštos kodavimo sėkmės priklauso nuo svorių, palyginti su tiksliai sureguliuotais duomenimis ir apvalkalu, lieka neaišku.
- 1 sistemos rėminimas gali suplonėti, kai užduotims reikia ilgalaikio planavimo, o ne lokalių refleksų.
- CLM-35B gali išlaikyti delsos istoriją arba tapti dar viena stipria vidutinio dydžio LLM.
- Kontrastingos veiksmų nuostatos gali tapti trapios keičiantis platinimui – naujoms kalboms, naujiems debesijos komandų sąsajoms, priešiškoms saugykloms.
- Saugumo istorijai vis dar reikia turinio, kai veiksmai vykdomi milisekundėmis.
Tai ne gudrybės, skirtos komandai apmėtyti. Tai patikrinimai, kuriuos turėtų atlikti bet kuri rimta diegimo peržiūra. Ankstyvieji atviri leidimai nusipelno kruopštaus tyrimo ir trinties, o ne aklo diegimo.
Esmė
CLM-8B yra atviras, „Apache“ pagrindu sukurtas (pagal aprėptį) kontrastinės kalbos modelis, skirtas greitam agentų būsenos ir veiksmo elgesiui. Jį viešai pristatė Jacky Kwok, pasitelkus Azalios Mirhoseini sustiprinimą, ir jis suformuluotas kaip su Stanfordo/NVIDIA susijęs tyrimas. Pagrindiniai teiginiai – iki maždaug 9 kartų greitesnis nei „Jev“ klasės išvados, stiprūs „DeepSWE“ ir „Terminal-Bench“ rezultatai po nedidelio tikslinimo, panaši nulinio taško kokybė su daug mažesne delsa, įskaitant pokalbius apie ~32 ms klasės terminalo atsakus – yra autorių pranešta ir vis dar laukiama plataus trečiosios šalies patvirtinimo. Didesnis CLM-35B modelis jau netrukus bus sukurtas.
Jei kuriate agentines kodavimo sistemas, verta atidžiai jas įvertinti, o ne įvaldyti. Traktuokite tai kaip potencialų 1-osios sistemos valdiklį hibridiniame steke, išmatuokite savo pačių sukurtą sistemą ir ant kiekvienos diagramos laikykite CLAIM lipduką, kol pasirodys nepriklausomi bandymai. Įdomiausia yra ne dar vienas pokalbių modelis su nauju logotipu. Įdomu tai, ar sprendimais pagrįsti mokymai gali priversti agentus pasijusti iš karto, nepadarydami jų neapgalvotai klystančiais.
Praktinis pavyzdys: CLM-8B latencijos kritinio agento mikrokilpos vertinimo kūrimas
Autorių sudarytos diagramos apie ką tik išleistą CLM-8B: naujas atvirojo dirbtinio intelekto modelis, kuris, kaip teigiama, agentams yra iki 9 kartų greitesnis nei Jev, gali atrodyti įtikinamai; jūsų balsas yra vienintelis svarbus. Štai kaip JK nepriklausoma įrankių komanda CLM-8B laikė potencialiu „System 1“ valdikliu, o ne pokalbių pakaitalu, ir išmatavo jį savo terminalo mikrokilpoje.
Scenarijus
Semas valdo nedidelį produktą, kuris jau naudoja sunkesnį kodavimo agentą kelių failų pertvarkymams. Sunkiausia dalis yra karštasis ciklas: nuskaitykite nepavykusį testo transkriptą, pasirinkite kitą apvalkalą arba redagavimo veiksmą, paleiskite jį, pakartokite. Vartotojai mažiau skundžiasi nuobodžiais atsakymais nei žieminių pirštinių vėlavimu per penkiasdešimt įrankio žingsnių. Socialinių tinklų įrašai sustiprina kontrastinės kalbos modelio svorius ir tariamą ~9 kartus didesnį pagreitį, palyginti su „Jev“ klasės analogais, bei stiprius „DeepSWE“ / „Terminal-Bench“ rodiklius po nedidelio koregavimo. Semas atsisako perrašyti produkciją spaudos diagramoje.
Jie išskyrė vieną delsos požiūriu kritinę mikrociklą: dvidešimt ištaisytų klaidų taisymo pėdsakų iš savo monorepo. Dabartinis darbinis arkliukas išlieka naujų architektūrų bilietų svarstymo kelias. CLM-8B, jei jis talpinamas ir šiek tiek pakoreguojamas pagal pėdsakus, gali konkuruoti tik „pasirinkite kitą grįžtamąjį veiksmą“ etape, o lėtesnis samprotavimo įrankis naudojamas kaip avarinis liukas, kai patikimumas mažas.
Tikslas yra A/B, kuriame būtų išlaikytas pastovus sujungimas: tie patys įrankiai, tas pats leidžiamųjų sąrašas, ta pati pakartotinio bandymo politika. Registruojami veiksmai per sekundę, p50/p95 delsa, užduočių sėkmė ir žmonių įsikišimai – tada nusprendžiama, ar laisvi svoriai uždirba vietą.
Ko reikia asistentui
- Dvidešimt anonimizuotų nesėkmingų testų sekų iš realaus darbo (tik įvesties duomenys + leistini įrankiai)
- Fiksuotas agento apvalkalas: įrankių schema, leidžiamųjų sąrašas, maksimalus veiksmų skaičius ir „lėtų argumentų iškvietimo“ šaka
- Baziniai balai pagal dabartinį modelį toms pačioms dvidešimčiai užduočių
- CLM-8B pagrindinio kompiuterio aparatinės įrangos pastabos (GPU klasė, tikslumas, paketinis veikimas), taigi „greitesnis“ turi nuorodą
- A CLAIM lipduko taisyklė: autorius DeepSWE / Terminal-Bench / ~9× / ~32 ms skaičiai lieka pažymėti tol, kol šis laidas kažką atkuria
- Žmogus savininkas, kuris peržiūri neteisingus, bet greitus veiksmus prieš bet kokį CI įdiegimą
Instrukcijos pavyzdys
Jūs padedate man sukurti sąžiningą CLM-8B A/B kaip greito būsenos → veiksmo valdiklį mūsų kodavimo agente. Naudokite tik mano įklijuotus jungties duomenis. Neišgalvokite delsos daugiklių, „DeepSWE“ balų ar licencijos sąlygų.
Užduotis: Remdamiesi dvidešimties mano užduočių pavadinimų ir dabartiniais pradiniais užrašais, sudarykite (1) vertinimo lapo su stulpeliais „Užduotis / Modelis / Žingsniai / Sieninis laikrodis / Sėkmė (išlaikyta / neišlaikyta) / Žmogaus įsikišimas (taip / ne) / Pastabos“ projektą, (2) šešių punktų protokolą, kuris visuose modeliuose išlaikytų vienodą apvalkalą, ir (3) aiškią, kasdienėje praktikoje suformuluotą sprendimo taisyklę, kada CLM-8B gali valdyti mikrokilpą, o kada mes pereiname prie lėto samprotavimo metodo.
Apribojimai: JK anglų kalba. Kiekvieną autoriaus pateiktą skaičių pažymėkite kaip PATEIKIMĄ, jei jis pasirodo. Pirmenybę teikite grįžtamiesiems įrankiams. Uždrauskite formuluotę „agentai galiausiai išsprendė“. Jei mano įklijuotame tekste trūksta metrikos, rašykite [REIKIA MATAVIMO], o ne spėliokite.
Išvestis: vertinimo lapo antraštė ir viena užpildyta pavyzdžio eilutė su vietos rezervavimo ženklais, protokolo ženkleliai, tada eskalavimo/palikimo taisyklė. Nėra preambulės.
Kaip tai išbandyti
- Paleiskite tuos pačius dešimt sekų dabartiniame darbiniame arkliuke ir CLM-8B tiksliojo derinimo įrenginyje su identišku apvalkalu. Patikrinkite tik sieninio laikrodžio ir sėkmės skirtumus, o ne įrankių sąrašus.
- Paklauskite: „Kuris autoriaus grafikas gali pakeisti gamybą šią savaitę?“ Geras atsakymas: jokiu, kol šis derinys neparodys sėkmės ir vėlavimo kartu.
- Kraštinis atvejis: CLM-8B atsako per ~30 ms su destruktyvios komandos pasiūlymu – patvirtinkite leidžiamųjų sąrašą ir žmogaus peržiūra jį aptinka prieš CI.
- Kraštinis atvejis: naujas API bilietas už dvidešimties sekų ribų – patvirtinkite, kad jį valdo lėtas samprotavimo įrankis, o ne refleksinis modelis.
- Priėmimo patikrinimai: (1) nėra išgalvoto 9× teiginio kaip išmatuoto rezultato, (2) užregistruotas p50 ir p95 delsos laikas, (3) sėkmės vardiklis yra dvidešimt užduočių, (4) suskaičiuoti neteisingi greiti veiksmai, (5) „Apache“ / licencijos patikrinimas atliekamas neprisijungus prieš bet kokį komercinio pristatymo planą.
Rezultatas
Iliustracinis rezultatas (pavyzdinis įvertis vienai trijų asmenų įrankių komandai, atliktai su dvidešimčia fiksuotų monorepo kreivių, o ne nepriklausomas laboratorinis autorių darbo vietų pakartojimas): bazinis darbinis arkliukas baigė 14 iš 20 kreivių be žmogaus pagalbos; vidutinė žingsnio delsa apie 180 ms; dviem kreivėms reikėjo žmogaus pagalbos po neteisingo redagavimo. Po nedidelio CLM-8B patikslinimo vidiniuose kreivėse (tas pats apvalkalas), 15 iš 20 sėkmingai atliko užduotį be žmogaus pagalbos; vidutinė žingsnio delsa vieno GPU pagrindiniame kompiuteryje buvo apie 45 ms; prieš pritaikant leidžiamųjų sąrašą, leidžiamasis sąrašas užfiksavo dar vieną neteisingą greitą veiksmą. Dvidešimties kreivių rinkinio sieninis laikrodis sutrumpėjo nuo maždaug 38 minučių iki maždaug 22 minučių, įskaitant patvirtinimo veiksmus. Higienos kontroliniame sąraše (sąranka laikoma pastovi, CLAIM etiketės išsaugotos autorių diagramose, lėtas samprotavimo įrankis vis dar naudojamas naujiems bilietams, eksperimentiniame agente nėra gamybos paslapčių) sėkmingai atliko užduotį. Apribojimai: mažas užduočių rinkinys, viena aparatinės įrangos klasė, dominuoja tiksli duomenų kokybė; Tai nepatvirtina autorių pateiktų ~9× arba „DeepSWE“ skaičių už šių pakinktų ribų.
Norėdami įvertinti savo versiją: užfiksuokite dvidešimt kreivių; pirmiausia įvertinkite dabartinį modelį; sukurkite CLM-8B talpą su dokumentuotais tikslumais / nustatymais; paleiskite iš naujo su tuo pačiu apvalkalu; praneškite apie sėkmę / n, p50 / p95, intervencijas ir ar kuris nors CLAIM numeris buvo traktuotas kaip faktas.
Kas gali nutikti ne taip
- Diagramų garbinimas: Pristatymas ~9× skaidrėje be savo p95.
- Greiti ir neteisingi veiksmai: momentinės, užtikrintos klaidos, lenkiančios lėtas ir teisingas klaidas didelės rizikos repo pozicijose.
- Diržų poslinkis: įrankių raginimų keitimas tarp modelių ir to pavadinimas modelio laimėjimu.
- Vieno herojaus stekas: atsisakoma svarstymo metodo naujiems architektūros darbams.
- Licencijų perdavimas: pasitikima aprėpties santraukomis, o ne tikrais svorio saugyklos licencijų failais.
- Šešėlinis kintamasis ryšys (Shadow CI): greito atvirojo agento įdiegimas į vamzdynus be greičio apribojimų ar įpurškimo peržiūros.
Praktiškas išsinešimui skirtas maistas
CLM-8B vertas tikslingo įvertinimo kaip kandidatas į 1-osios sistemos valdiklį agentiniam kodavimui – atviri svoriai, sprendimu pagrįsti siužetai, autoriaus pateikti greičio teiginiai. Tai nėra įsitikinimas ir neįrodytas 9× našumas jūsų stekui, kol to nenurodo jūsų įranga. Laikykite apvalkalą pastovų, registruokite veiksmus per sekundę ir neteisingo greičio rodiklį, palikite lėtesnį avarinį liuką ir palikite CLAIM lipduką ant kiekvienos spaudos diagramos, kol bus atlikti nepriklausomi bandymai (įskaitant jūsų).
DUK
Kas yra CLM-8B ir kodėl agentų kūrėjai apie tai kalba?
CLM-8B yra pirmasis viešas svorių rinkinys „Contrastive Language Model“ linijoje – atvirame tyrimų pranešime, pristatytame kaip greitas sprendimų ciklas agentams, o ne tiesiog dar vienas pokalbių protas. Mokymo istorija susieja būsenas su veiksmais labiau kaip „System 1“ refleksas, o ne lėtas kito žetono rašinys. Esant aštuoniems milijardams parametrų, jis yra pakankamai mažas, kad jį galėtų talpinti daugelis laboratorijų ir nepriklausomų kūrėjų, o „Apache 2.0“ licencijavimas yra įtrauktas į aprėptį aplink kritimą. Paleidimo įrašuose pateikti skaičiai yra autorių pateikti teiginiai, o ne nepriklausomi laboratorijų pakartojimai.
Kaip CLM-8B teigia esąs iki 9 kartų greitesnis už Jev agentų atžvilgiu?
Kūrėjai teigia, kad išvados atliekamos iki maždaug 9 kartų greičiau nei „Jev“ klasės modeliai, o terminalo testavimo aplinkoje jų atsako laikas yra maždaug 32 ms. Po nedidelio tikslinimo jie taip pat praneša apie stiprius agentinio kodavimo rezultatus – „DeepSWE“ apie 81,6 %, o „Terminal-Bench 2.1“ apie 87,6 % – ir tam tikrą „zero-shot“ kokybę, panašią į „Jev“, esant daug mažesnei delsai. 9 kartus ir milisekundžių skaičius laikykite teiginiais, kol trečiosios šalys jų neatkurs bendrai naudojamoje įrangoje. Santykiniam greičiui vis tiek reikia nurodyti partijos dydį, tikslumą ir dekodavimo nustatymus.
Kuo skiriasi kontrastinio kalbos modelio mokymai nuo įprastų teisės magistro (LLM) studijų?
Dauguma gamybinių LLM kursų vienu metu generuoja po vieną žetoną, kuris tinka prozai ir ilgiems samprotavimams, tačiau apmokestina kiekvieną agento priimamą mikrosprendimą. Gretinamosios kalbos modelio mokymas, kaip jį apibūdina rengėjai, stumia tinklą susieti situacijas su pageidaujamais veiksmais – labiau kaip politikos vadovas nei romanistas. Toks 1-osios sistemos įrėminimas pirmenybę teikia greitiems būsenos ir veiksmo ciklams, o ne amžinam pasakojimui tarp įrankių iškvietimų. CLM-8B vis dar gali skleisti tekstą; tikslo ir vertinimo istorija yra linkusios į agentinę kontrolę.
Kas išleido CLM-8B ir ar jis tikrai atviras?
Jacky Kwok pristatė darbą; Azalia Mirhoseini jį išplėtojo; apžvalga apibūdina Stanfordo ir NVIDIA komandos pastangas su įvardytais tyrėjais, viešais svoriais ir atviru kodu. Leidimui taikoma „Apache 2.0“ licencija, kuri yra svarbi tiksliam derinimui ir platinimui, tačiau prieš pasikliaudami apžvalgos santraukomis, perskaitykite licencijų failus saugykloje. Įvardyti atviri leidimai paprastai yra testuojami nepalankiausiomis sąlygomis greičiau nei anoniminiai failai. Plačiam trečiųjų šalių replikavimui dar per anksti.
Kodėl būsenos ir veiksmo ciklai yra tokie svarbūs agentiniam kodavimui?
Agentinis kodavimas dažnai būna dvejetainis: testas arba gauna žalią rezultatą, arba ne, todėl švarūs veiksmų pasirinkimai pranoksta gražius nesėkmių rašinius. Vėlavimo laiko junginiai dešimčių įrankių žingsnių metu – tiek žingsnio trukmės sutrumpinimas, tiek sieninio laikrodžio, tiek debesijos sąskaitos keičiasi. Teigiamas dydžio eilės pagreitis, palyginti su „Jev“ klasės lygiaverčiu, net jei realiai jis pasiekia „tik“ 4 kartus, vis tiek pertvarko pajėgumų planavimą. Hibridiniai stekai – greitas CLM tipo valdiklis ir sunkesnis samprotavimo įrankis kietose šakose – yra reali ilgalaikė forma.
Ar turėčiau pasitikėti „DeepSWE“ ir „Terminal-Bench“ CLM-8B balais?
Šie rinkiniai baudžia trapius agentus, todėl ~81,6 % „DeepSWE“ ir ~87,6 % „Terminal-Bench 2.1“ po nedidelio tikslinimo atrodo įdomiai. Agentų suolai taip pat apdovanoja pastolių naudojimu: diržų kokybė, įrankių leidžiamųjų sąrašai ir atkūrimo raginimai gali padidinti sėkmę dviženkliais skaitmenimis. Prieš laikydami lentelę nusistovėjusiu mokslu, įsigilinkite į tai, koks apvalkalas buvo aplink svorius. Autorių suolai yra rinkodara, kol kas nors kitas jų neatkuria su dokumentuotais receptais.
Ką turėčiau žinoti apie CLM-35B ir 8B modelio tikslų derinimą?
Kaip planas minimas didesnis CLM-35B tęsinys; ar bus išlaikyta delsa, ar greitis pakeistas gyliu, dar neaišku. Realus kelias į stiprius skaičius yra CLM-8B koregavimas pagal jūsų pačių virpesių taisykles, CLI diegimas ir monorepo pėdsakai – ne nulinio smūgio magija pirmąją dieną. Komandos gali išlaikyti abu dydžius, jei joms pasiseks: 8B karštiems ciklams, 35B sudėtingam planavimui. Atviri svoriai taip pat palengvina netinkamą naudojimą, todėl apsauginiai turėklai ir greičio apribojimai yra produktas, o ne pasirenkamas kostiumas.
Kaip turėčiau skaityti palyginimus su Jevu, kad neužsnigčiau?
„Jev“ klasės palyginimai suteikia „iki 9 kartų greitesnį“ lygiaverčių procesorių, kuris padeda pasiūlymui nusileisti. Pavojus yra tas, kad partijos dydis, tikslumas, konteksto ilgis ir įrankio iškvietimo serializacija sujungiami į vieną daugiklį. Kai „chatter“ cituoja ~32 ms klasės atsakymus, paklauskite savęs, ar tai reiškia pirmąjį prieigos raktą, viso veiksmo JSON, ar talpykloje saugomą prefiksą. Įvertinkite užduoties sėkmę, kiekvieno išspręsto bilieto kainą ir žmogaus įsikišimo dažnį jūsų steke. Konkurencijos naratyvai verčia laboratorijas skelbti skaičius; jūsų gamybos KPI vis tiek lemia.
Ką statybininkai turėtų daryti prieš įdėdami CLM-8B į gamybos agentus?
Išskirkite delsos požiūriu kritinę dalį, pavyzdžiui, terminalo mikrociklą, ir tiksliai suderinkite A/B su dabartiniu darbiniu arkliuku, laikydami jungtį pastovią. Stebėkite neteisingus, bet greitus veiksmus; pridėkite patikrinimą, pirmenybę teikkite grįžtamiesiems įrankiams ir numatykite lėtesnio samprotavimo funkciją, kai patikimumas mažas. Stebėkite veiksmus per sekundę kiekvienam GPU, o ne tik žetonus per sekundę. Neklijuokite gamybos paslapčių į eksperimentinius agentus ir palikite CLAIM lipduką ant kiekvienos spaudos diagramos, kol bus gauti jūsų pačių bandymai.
Kaip sukurti sąžiningo delsos mikrociklo vertinimą CLM-8B Just Dropped paraiškoms?
Užfiksuokite nedidelį realių nesėkmingų testų sekų rinkinį, išsaugokite tą pačią įrankių schemą ir leidžiamųjų sąrašą visuose modeliuose ir užregistruokite veiksmus, sieninį laikrodį, sėkmę ir žmogaus įsikišimus. Naudokite CLM-8B tik žingsnyje „pasirinkite kitą grįžtamąjį veiksmą“, jei paliksite apsvarstymo avarinį liuką naujiems bilietams. Pažymėkite autoriaus ~9×, „DeepSWE“ ir milisekundžių skaičius kaip CLAIM, kol šis paketas parodys pergalę sėkmės ir delsos atžvilgiu kartu. Toks sufokusuotas vertinimas pranoksta gamybos perrašymą skaidrių dene.
Nuorodos
- Apkabinantis veidas — Gretinamoji kalbos modelis (CLM-v0.1-8B) — huggingface.co
- GitHub — Kontrastinis-LM / CLM — github.com
- Stanfordo universitetas – Azalia Mirhoseini – cs.stanford.edu
- Jacky Kwok — jackyk02.github.io
- X — Jacky Kwok pristatymas — x.com
- DeepSWE — deepswe.datacurve.ai
- Snorkel AI — Terminal-Bench 2.1 — snorkel.ai
- Jev — jevtypesafeai.com