Meet SWE-Compass: A Real-World Benchmark for Coding AIs

Meet SWE-Compass: A Real-World Benchmark for Coding AIs

How good are today’s coding AIs at real developer work—not just toy puzzles? Meet SWE-Compass, a new benchmark that puts large language models (LLMs) through realistic, production-style tasks.

What’s new

  • Broad coverage: 8 task types across 8 development scenarios and 10 programming languages.
  • Real data: 2,000 carefully vetted cases sourced from authentic GitHub pull requests.
  • Agent workflows: Tested under two popular agent frameworks—SWE-Agent and Claude Code.
  • Wide model sweep: Results across 10 leading LLMs.
  • Actionable insights: Reveals a clear difficulty ladder by task, language, and scenario.

Why it matters: Many benchmarks overfit to algorithms or Python-only bug fixes. SWE-Compass aligns evaluation with real developer workflows, offering a rigorous, reproducible way to diagnose where coding AIs excel—or stumble—across languages and contexts.

For researchers and teams building AI dev tools, SWE-Compass is a compass for progress. Paper: http://arxiv.org/abs/2511.05459v1

Paper: http://arxiv.org/abs/2511.05459v1

Register: https://www.AiFeta.com

#AI #LLM #SoftwareEngineering #DevTools #Benchmark #OpenSource #GitHub #AgenticAI

Read more

Kun päällekkäisyys ei olekaan virhe: hermoverkot voivat hyödyntää “hälyä”

Kun päällekkäisyys ei olekaan virhe: hermoverkot voivat hyödyntää “hälyä”

Jos tekoäly järjestää sisäiset signaalinsa hyödyntämään sanojen yhteisesiintymiä, se voi vahvistaa oikeaa viestiä sen sijaan, että yrittäisi peittää kaiken päällekkäisyyden – ja tämä haastaa vallitsevan selitysmallin siitä, miten mallit ajattelevat. Kuvittele selaavasi reseptejä. Kun ruudulla vilahtaa “kahvi”, todennäköisesti näet pian “kupin” tai “mukin”. Me huomaamme tällaiset parit vaistonvaraisesti. Mutta mitä tapahtuu

By Kari Jaaskelainen
Synteettinen data parantaa satelliittikuvien tekoälyä, kun sisältö tarkistetaan sanoin ja kuvin

Synteettinen data parantaa satelliittikuvien tekoälyä, kun sisältö tarkistetaan sanoin ja kuvin

Kun kuvan piirteet nimetään ja kuvataan sanallisesti, tekoälyn harjoittamiseen luotu aineisto muuttuu ymmärrettäväksi – ja toimii paremmin kuin pelkkä oikea data yksinään. Kun avaa karttasovelluksen satelliittinäkymän, näkee ylhäältäpäin asioita, joita maan tasalla harvoin ajattelee: teiden suoruuden, jokien kiemurat, pellonlaidat, jotka asettuvat kuin palapelin palat. Juuri tällaisia kuvia koneoppimismallit yrittävät tulkita. Ne

By Kari Jaaskelainen
Huipputulokset koetesteissä eivät vielä todista aidosta päättelystä

Huipputulokset koetesteissä eivät vielä todista aidosta päättelystä

Kuvittele, että sinulle annetaan ohjelmointikirja kielellä, jota et ole koskaan nähnyt. Selailisit dokumentaatiota, kokeilisit esimerkkejä ja muuttaisit koodia, kunnes se toimii. Ihminen oppii näin varsin nopeasti uuden kielen alkeet. Mutta osaavatko myös tekoälymallit oppia uutta näin, vai toistavatko ne lähinnä asioita, joita ovat aiemmin nähneet? Viime vuosina suuret kielimallit ovat

By Kari Jaaskelainen
Tekoäly oppii katsomaan kuvia myös vietnamiksi, kun data ja mittarit päivitetään

Tekoäly oppii katsomaan kuvia myös vietnamiksi, kun data ja mittarit päivitetään

Matkalla otettu kuva torilta: muovipussissa vilahtaa keltainen hedelmä, ja joku kysyy puhelimelta vietnamin kielellä, mitä nainen pitää kädessään. Usein vastausta ei tule. Monelle kielelle tekoäly on oppinut puhumaan, mutta näkeminen ja vastaaminen yhtä aikaa on ollut pitkälti englannin varassa. Jo pitkään on ajateltu, että kunhan kielimalli on riittävän vahva, se

By Kari Jaaskelainen