2023년 최고의 오픈 소스 소프트웨어는?(Bossie Awards)
InfoWorld의 2023 Bossie Awards는 올해의 주요 오픈 소스 도구를 선정하며, 소프트웨어 개발, 데이터 관리, 분석, AI 및 기계 학습 분야에서 선도적인 도구를 포함합니다.
Apache Hudi: 데이터 레이크 또는 데이터 레이크하우스를 구축할 때 더 발전 가능하고 변경 가능한 플랫폼이 필요합니다. Apache Hudi는 빠른 데이터 형식, 테이블 및 SQL을 제공하며, 저 지연, 실시간 분석을 가능하게 합니다.
Apache Iceberg: Apache Iceberg는 Hive와 함께 작동하지만 Apache Spark 및 Apache Flink와도 직접 작동합니다. Iceberg는 모든 이러한 시스템에 대한 고성능 테이블 형식을 제공합니다.
Apache Superset: Apache Superset는 데이터 시각화의 몬스터로, 대규모로 자체 서비스, 고객 중심, 사용자 중심의 분석을 배포하려는 모든 사람에게 거의 유일한 선택입니다.
Bun: Bun은 서버 측 JS에 필요한 모든 것을 하나의 도구에 넣는 것을 목표로 합니다.
Claude 2: Claude 2는 100K 토큰(약 70,000단어)까지의 단일 프롬프트를 수용하며, 몇 천 토큰까지의 이야기를 생성할 수 있습니다.
CockroachDB: 분산 SQL 데이터베이스인 CockroachDB는 데이터베이스 읽기 및 쓰기의 수평 확장을 가능하게 하여 고성능, 트랜잭션 중심의 애플리케이션에 대한 주요 확장성 문제를 해결합니다.
CPython: Python 프로그래밍 언어를 사랑하는 이유는 무수히 많습니다. 그러나 런타임 성능은 그 중 하나가 아닙니다.
DuckDB: OLAP 데이터베이스는 거대해야 한다고 생각할 수 있습니다. 그러나 더 깊게 살펴보면, Polars가 바로 원하는 것일 수 있습니다.
HTMX 및 Hyperscript: HTML이 결코 변경되지 않을 것이라고 생각했을 것입니다. HTMX는 알고 있고 사랑하는 HTML을 가져와 현대 웹 애플리케이션을 작성하기 쉽게 만드는 확장 기능을 제공합니다.
Istio: Istio는 컨테이너 기반의 마이크로서비스에 대한 네트워킹 및 통신을 단순화하는 서비스 메시입니다.
Kata Containers: Kata Containers는 Intel Clear Containers와 Hyper.sh runV를 사용하는 보안 컨테이너 런타임입니다.
LangChain: LangChain은 언어 모델을 기반으로 한 애플리케이션 개발을 용이하게 하는 모듈식 프레임워크입니다.
Language Model Evaluation Harness: 새로운 큰 언어 모델(LLM)이 출시되면, 특정 벤치마크에서 ChatGPT와 비교하여 모델을 평가하는 점수를 볼 수 있습니다.
Llama 2: Llama 2는 Llama 1보다 40% 더 많은 데이터(공개적으로 사용 가능한 소스에서 2조 토큰)에 대한 교육을 받았으며 컨텍스트 길이가 두 배입니다.
Ollama: Ollama는 macOS와 Linux에서 로컬로 Llama 2, Code Llama 및 기타 모델을 실행할 수 있는 명령 줄 유틸리티입니다.
Polars: Python이 이미 유명한 Pandas를 가지고 있을 때 또 다른 데이터 프레임 랭글링 라이브러리가 필요한 이유는 무엇일까요? Polars는 Pandas가 할 수 있는 모든 일을 할 수는 없지만, 할 수 있는 일은 절반의 메모리로 판다보다 최대 10배 더 빠르게 처리합니다.
PostgreSQL: PostgreSQL은 700명 이상의 기여자로부터의 입력을 받아 35년 이상 개발되어 왔으며 관계형 데이터베이스 관리 시스템 중에서 16.4%의 시장 점유율을 차지하고 있습니다.
QLoRA: Tim Dettmers와 팀은 모든 것에서 토스터까지 큰 언어 모델을 실행하는 데 목표를 두고 있는 것처럼 보입니다.
RAPIDS: RAPIDS는 일반 데이터 과학 및 분석 작업을 위한 GPU 가속 라이브러리 모음입니다.
Spark NLP: Apache Spark에서 실행되는 자연어 처리 라이브러리로 Python, Scala, Java를 지원합니다. 이 라이브러리는 개발자와 데이터 과학자가 Google, Meta, OpenAI 등에서 제공하는 대형 언어 모델을 실험하도록 도와줍니다. 2023년에는 많은 LLM 통합, 새로운 이미지-텍스트 주석 도구, 모든 주요 공용 클라우드 저장 시스템 지원, ONNX 지원 등이 추가되었습니다.
StarRocks: 현대의 분석은 복잡한 데이터를 실시간으로 수백만 사용자에게 제공하는 경향이 있습니다. StarRocks는 효율적인 비용 기반 최적화, SIMD 명령 세트를 사용한 벡터 처리, 캐싱 및 물리화 된 뷰를 결합하여 대규모 조인을 효율적으로 처리하는 쿼리 엔진입니다.
TensorFlow.js: Google의 TensorFlow 기계 학습 프레임워크의 능력을 JavaScript 패키지로 제공하여 JavaScript 개발자에게 최소한의 학습 곡선으로 특별한 기능을 제공합니다.
vLLM: 대형 언어 모델을 프로덕션에 배포하는 데 있어서의 돌풍은 추론을 가능한 한 빠르게 만드는 프레임워크의 급증을 초래했습니다. vLLM은 Hugging Face 모델 지원, OpenAI 호환 API 및 PagedAttention을 완벽하게 지원합니다.
Weaviate: 생성형 AI 붐은 복잡하고 비구조화된 대량의 데이터를 지원할 수 있는 새로운 유형의 데이터베이스가 필요하게 했습니다. Weaviate는 키워드 검색과 벡터 검색을 결합하여 다양한 형태의 데이터를 빠르고 확장 가능하게 검색합니다.
Zig: 오늘날의 모든 오픈 소스 프로젝트 중에서 Zig는 가장 중요할 수 있습니다. Zig는 프로그램 수준의 메모리 제어를 갖춘 일반적인 목적의 프로그래밍 언어를 만드는 노력입니다.
이러한 프로젝트들은 각각의 분야에서 혁신적인 변화와 발전을 가져올 것으로 예상됩니다.
자세한 내용은 : https://www.infoworld.com/article/3709196/the-best-open-source-software-of-2023.html
