回顾十年数据库流行度，哪款是你的最爱

2022-05-23 13:52:40

来自公众号：萝卜大杂烩
作者：周萝卜，Python 学习者。爱好爬虫、数据分析及可视化等

准备写一个系列，在年终岁尾之际，盘一盘大家或者是本人比较关心的一些数据。文章内容会包括数据获取的过程和数据可视化结果。今天先来看看各大数据库在过去一年的表现吧！

先来看看数据库流行度总体走势

点击这里

数据获取

所有的数据都来源自网站：https://db-engines.com/，一个数据库流行趋势统计网站。

Method 1

我们先来看获取数据方法一
首先我们可以在下面地址中看到一个包含所有数据库信息的表格

https://db-engines.com/en/ranking

然后可以进入到每个数据库详情页面中，该数据库历年流行度数据都会在页面加载之后包含在 JavaScript 的变量中

https://db-engines.com/en/ranking_trend/system/Oracle

所以我们可以通过解析该 JavaScript 代码来获取每个数据库的历年数据，同时为了加快抓取速度，使用了异步请求

先抓取所有数据库名称信息，通过 pandas 的 read_html 方法可以方便的读取 html 中的 table 数据

import pandas as pd


mystr = ' Detailed vendor-provided information available'


def set_column3(column3):
    if mystr in column3:
        column3 = column3.split(mystr)[0]
    return column3


url = 'https://db-engines.com/en/ranking'
tb = pd.read_html(url)
db_tb = tb[3].drop(index=[0, 1, 2])[[0, 1, 2, 3, 4, 5, 6, 7]]


# 处理数据
db_tb[3] = db_tb[3].apply(set_column3)

# 保存数据
db_tb.to_csv('db_tb.csv')

异步抓取数据库详细信息

async def fetch(session, url):
    async with session.get(url) as response:

        return await response.text()


async def get_db_data(db_name):
    url = 'https://db-engines.com/en/ranking_trend/system/%s' % db_name

    async with aiohttp.ClientSession() as session:
        res = await fetch(session, url)
        content = BeautifulSoup(res, "html.parser")
        content.find_all("script")
        db_data = content.find_all("script")[2].string
        src_text = js2xml.parse(db_data)
        src_tree = js2xml.pretty_print(src_text)
        data_tree = BeautifulSoup(src_tree, 'html.parser')
        data_tree.find_all('number')
        data = []
        for i in data_tree.find_all('number'):
            data.append(i['value'])

        date_list = gen_time('%s-%s' % (data[0], str(int(data[1]) + 1)))
        date_value = list(zip(date_list, data[3:]))
        d_data = zip([db_name for i in range(len(date_value))], date_value)

        await save_data(d_data)


def gen_time(datestart, dateend=None):
    if dateend is None:
        dateend = time.strftime('%Y-%m', time.localtime(time.time()))
    datestart=datetime.datetime.strptime(datestart, '%Y-%m')
    dateend=datetime.datetime.strptime(dateend, '%Y-%m')
    date_list = list(OrderedDict(((datestart + timedelta(_)).strftime(r"%Y-%m"), None) for _ in range((dateend - datestart).days)).keys())
    date_list.append('2019-12')
    return date_list


if __name__ == '__main__':
    db_tb = pd.read_csv('db_tb.csv')
    db_name = db_tb['3'].values.tolist()
    loop = asyncio.get_event_loop()
    tasks = [get_db_data(name) for name in db_name]
    loop.run_until_complete(asyncio.wait(tasks))
    loop.close()

Method 2

下面再来介绍第二种方法，方法更简单，但是抓取时需要处理的地方更多些

我们可以直接访问下面的地址，同样的，在页面加载完成后，会返回所有数据库的历年数据信息

https://db-engines.com/en/ranking_trend

那么我们就可以直接解析此处的 JavaScript 信息，获取对应数据库的数据即可

不过由于有些数据库的历史数据有缺失，所以需要做特殊处理

for i in data_tree.find_all('object'):
        date_list = gen_time('%s-%s' % (year_list[0], str(int(year_list[1]) + 1)))
        data = []
        tmp_list = []
        db_name = i.find('string')
        if i.find('null'):
            null_num = len(i.find_all('null'))
            tmp_list = list(zip(date_list[:null_num], ['0' for i in range(null_num + 1)]))
            date_list = date_list[null_num:]
        for j in i.find_all('number'):
            data.append(j['value'])

两种方法各有优缺点，小伙伴儿们可以自行选择适合自己的方式。

拿到数据之后，我们就可以做统计分析啦