Mining source code from GitHub repositories
Author
Якубів, В. Р.
Терлецький, Д. О.
Yakubiv, V.
Terletskyi, D.
Date
2026Metadata
Show full item recordAbstract
GitHub став однією з найпоширеніших платформ для розміщення коду та інтелектуального аналізу даних з репозиторіїв. Однак видобуток вихідного коду з GitHubʼа створює труднощі, зокрема строге обмеження в 30 запитів за хвилину на API пошуку. Ми пропонуємо методологію для видобутку даних з репозиторіїв програмного забезпечення, засновану на філософії UNIX та концепції інструменту збірки Make, ставлячи в пріо ритет модульний дизайн, композицію та вивід у текстові файли. Запропонований підхід застосовує прогресивне уточнення та фільтрацію і підходить для збору вихідного програмного коду, коли релевантні репозиторії Git не відомі апріорі. GitHub has become one of the most widely used platforms for code hosting and repository mining. However, mining source code from GitHub presents challenges, most notably, a strict rate limit of 30 requests per minute imposed on the search API. We propose a methodology for mining software repositories based on the UNIX philosophy and the concept of the Make build tool, prioritising modular design, composition, and text-based output to files. The proposed approach applies progressive refinement and filtering, and is suitable for collecting datasets of any kind of source code where relevant Git repositories are not known a priori.
URI:
https://ir.lib.vntu.edu.ua/handle/123456789/54338

