专栏名称: SegmentFault思否
SegmentFault (www.sf.gg)开发者社区,是中国年轻开发者喜爱的极客社区,我们为开发者提供最纯粹的技术交流和分享平台。
目录
相关文章推荐
码农翻身  ·  漫画 | 为什么大家都愿意进入外企? ·  昨天  
OSC开源社区  ·  升级到Svelte ... ·  4 天前  
程序猿  ·  “我真的受够了Ubuntu!” ·  3 天前  
程序猿  ·  “未来 3 年内,Python 在 AI ... ·  4 天前  
程序员的那些事  ·  惊!小偷“零元购”后竟向 DeepSeek ... ·  3 天前  
51好读  ›  专栏  ›  SegmentFault思否

用 PHP 和 Python 生成短链接服务的字符串 ID

SegmentFault思否  · 公众号  · 程序员  · 2018-10-23 08:00

正文

假设你想做一个像微博短链接那样的短链接服务,短链接服务生成的URL都非常短例如: http://t.cn/E70Piib, 我们应该都能想到链接中的E70Piib对应的就是存储长链接地址的数据记录的ID,可是这个有大小写字母和数字构成的唯一ID是怎么生成的呢,刚学编程的时候我们用的方法都试拼接一个足够唯一的字符串(比如时间戳加用户ID等等)然后再用MD5或者SHA1散列算法算出一个散列值,用这种方法得到的唯一ID有可能比原始的链接的长度还要长,所以如何来优雅的生成足够短的字符串唯一ID呢?

我们先来看一个数学问题,普通的数字ID是用十进制来表示的,在十进制中每位都有10种可能(0-9),所以5位的十进制数能呈现最多 10 * 10 * 10 * 10 * 10 = 100 , 000 个ID。

现在如果用32进制来表达一个5位数字需要多少位呢?

  1. php

  2. echo base_convert(10000, 10, 32); //答案是 '90g'

32进制是数字和一些小些字母来组成,所以5位32进制可表达的唯一ID有 32 * 32 * 32 * 32 * 32 = 33 , 554 , 432 个,数量已经很大了。

使用32进制也能生成比较短的字符串唯一ID,不过还有更好的解决方案,你也看到了上面短链接的唯一ID里还包含大写字母。

接下来我们使用62进制转换,将一个十进制数字转化为对应的62进制表示(为什么用62进制?数字加大小写字母一共是62个)。

常用的这几个编程语言里没有提供62进制的转换,所以就需要我们自己写一个函数来进行10进制到62进制的转换。

  1. /**

  2. * Convert a numeric string from base 10 to another base.

  3. *

  4. * @param $value  decimal string

  5. * @param int $b  base , max is 62

  6. * @return string

  7. */

  8. function to_base($value, $b = 62)

  9. {

  10.    $base = '0123456789abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ';

  11.    $r = $value  % $b;

  12.    $result = $base[$r];

  13.    $q = floor($value / $b);

  14.    while ($q)

  15.    {

  16.        $r = $q % $b;

  17.        $q = floor($q / $b);

  18.        $result = $base[$r].$result;

  19.    }

  20.    return $result;

  21. }

  22. /**

  23. * Convert a 10 base numeric string to a 62 base string

  24. *

  25. * @param  int     $value

  26. * @return string

  27. */

  28. function base62_encode($value)

  29. {

  30.    return to_base($value, 62);

  31. }

定义好上面的函数后,让我们将100,000,000 转换成62进制试一试:

  1. echo base62_encode(100000000); //结果是6LAze

理解了将十进制正整数转换成62进制的字符串表示形式的原理后,在任何编程语言里都可以很轻松地实现一个转换函数,下面再提供一个Python版本的 Base62 . encode

  1. #!/usr/bin/python

  2. # -*- coding=UTF-8 -*-

  3. from __future__ import print_function, division

  4. BASE62 = "0123456789abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ"

  5. def encode(num, alphabet=BASE62):

  6.    """Encode a positive number in Base X

  7.    Arguments:

  8.    - `num`: The number to encode

  9.    - `alphabet`: The alphabet to use for encoding







请到「今天看啥」查看全文