Wpis z mikrobloga

#sztucznainteligencja #programowanie #programista15k #it

Mireczki, jak macie problem z wrzucaniem dużych danych do kontekstu a jak robicie duże projekty z ai pewnie tak jest polecam linka

data2prompt

zamiast kopiować pliki iinteligentnie sampuje i obcina pliki z danymi, wyciąga schematy, formatuje to tak żeby attention mechanism modelu faktycznie z tego korzystał a nie walczył z entropią tokenu

projekt jest celowo wąski to nie jest narzędzie do dużych pure-code repozytoriów, robi swoje tylko dla projektów data-heavy: .csv, .sql, .xlsx, .ipynb. i robi to dobrze

główny ból który rozwiązuje: generyczne code-to-prompt toole albo skipują pliki z danymi albo wrzucają je raw w obu przypadkach model albo nie ma kontekstu, albo marnuje 90% okna na bezsensowne rzędy danych

Znalazlembprzy debugowaniu pipelineów i code review notebooków z dużymi datasetami zamiast ręcznie wycinać i wklejać fragmenty, to robi to automatycznie zachowując semantyczną strukturę. A mam teraz jeden taki syf projekt gdzie tego jest masa

https://github.com/arianmokhtariha/data2prompt
  • 5
  • Odpowiedz
  • Otrzymuj powiadomienia
    o nowych komentarzach

@JamesJoyce: właśnie robie kolejny scrapper, przypomniało mi się o tym poście i chciałem użyć... ale to nie do HTML ;) ...na szczęście napisałem Cursorowi żeby obciął nieistotne rzeczy i sam zrobił rozwiązanie do usuwania śmieci
  • Odpowiedz