Python特性

一.深浅拷贝

往往到了深浅拷贝的时候,就是大家最容易蒙的地方,这个比较重要为什么这么说呢,因为面试的时候必问

都认真听,争取一遍就过,一般面试的时候都结合着赋值一起问

我们先说赋值,赋值就是一个容器有多个标签

lst = [1,2,3,[6,7,8]]

我们在程序这样写,当成程序执行完这两行的时候,内容空间发生的变化就是下图:

一个列表用两个标签,通过标签lst 找到的和标签lst1找到的是同一个,图中的那些一长串数字就是内存地址,Python中是通过内存地址来查看值

lst1 = lst
lst[-1].append(9)

我们通过lst这个标签找到这个列表然后添加一个9,再通过lst1找到这个列表也就多了一个9 因为lst和lst1都是贴在一个地方

我们再来说说浅拷贝,浅拷贝就是只拷贝第一层的元素

看例子:

lst = [1,2,3,[6,7,8]]
# lst2 = lst[:] # 浅拷贝
lst2 = lst.copy()

图中橙色的是新开辟的空间,浅蓝色的是数字类型,红色的列表类型

这样就是浅拷贝,浅拷贝只把原列表中记录的内存地址拿到一个新开辟的列表中

lst = [1,2,3,[6,7,8]]
lst2 = lst[:]
lst.append(9)

为什么lst1中没有添加,是因为咱们先进行的浅拷贝,浅拷贝把原列表中有的内存地址复制了一份放到新开辟的空间中,后期对原列表添加的内容新列表是不会有的,再看看下边的例子

lst = [1,2,3,[6,7,8]]
lst2 = lst.copy()
lst[1] = "22"

我们修改成字符串"22" 就是在列表中将以前的内存地址更换成新开辟的空间地址

lst = [1,2,3,[6,7,8]]
lst1 = lst.copy()
lst[-1].append(9)

因为我们对里边的列表进行修改,列表本身就是可变的数据类型,我们通过原列表修改最里层的小列表,小列表进行变化,新开辟的列表里存放就是小列表中的内存地址.在去查看的时候就有变动

我们接下来,来看看深拷贝是怎样的操作

import copy
lst = [1,2,3,[6,7,8,9]]
lst2 = copy.deepcopy(lst)

我们通过上图可以发现浅拷贝和深拷贝在最后列表的位置内存地址不一样,深拷贝是自己单独开辟了一个新的空间,我们现在修改原列表和新开辟的列表没有任何影响.

通过上面的各种测试,总结以下规律:

赋值:
- 两个或多个变量名指向同一个内存地址,有一个操作内存地址的值进行改变,其余的变量名在查看的时候都进行更改
浅拷贝:
- 只拷贝列表中第一层的内存地址,原列表修改了不可变数据类型,新开辟的列表不进行变动,因为只是在原列表中将内存地址进行修改了,新开辟的列表中的内存地址还是用的之前的内存地址
- 原列表对可变数据类型进行了添加,新开辟的列表中存放就是可变数据类型的地址,在去查看的时候就发现进行更改了
深拷贝:
- 不管你修改原数据的不可变类型还是可变类型,新开辟的空间中都不会进行改变,因为可变数据类型新开辟了一个空间

二、小数据池

== id is

我们讲解一下小数据池,这个东西不是咱们开发中需要使用的,那为什么要进行讲解呢,第一个是要解决你的疑问,第二个是现在面试会问.那我们就正式开始讲解了

两个等于我们都用过了，就是进行判断的。判断两边的值是否一样，例如

a = 10
b = 10
print(a == b) 

a = "alex"
b = "alex"
print(a == b)

这样就是查看==两边的值是否一样.

我们再来看看id是个什么东西，我们知道在定义一个变量的时候，内存空间中其实是开辟了一块空间，这个开辟的空间是有号码的，我们来试一下

name = "alex"
print(id(name))  
# 4327876736

is 也是判断,只不过这次判断的是两边值得内存地址是否相同,我们来看看

a = 10
b = 10
print(id(a))  # 4304849568
print(id(b))  # 4304849568
print(a is b)  # True
# 获取的结果是True是因为a和b的内存地址是相同的

发现一个问题 == 和 is 都是True啊,这个is是判断内存地址是否一样,Python考虑到我们会经常定义一些值,需要开辟空间和销毁空间,它底层就维护了一个小数据池,这个小数据就是规定一个区间使用的是同一个内存地址,比如小数据池中数字的区间范围是 -5 ~ 256,我们刚刚测试的10在区间内,所以获取到的是相同的内存地址,我们试一试不在范围的数字

a = 500
b = 500
print(id(a)) # 4344811120
print(id(b)) # 4344811120
print(a is b) # True

不再区间内，怎么内存地址还是一样的啊。这就要说说python的另一个机制 — 代码块

代码块是防止我们频繁的开空间降低效率设计的，当我们定一个变量需要开辟空间的时候，它会先去检测我们定义的这个值在空间中有没有进行开辟，如果没有开辟就开辟一个空间，如果内存中开辟过就使用同一个。

一个文件，一个函数，一个模块，一个类，终端中一行就是一个代码块

代码块支持：

字符串：
- 定义字符串的时候内容，长度任意内存地址相同。
- 字符串进行乘法的时候总长度 <=20 内存地址相同。
- 中文，特舒符号乘法的时候只能乘以1或 0
数字：
- 相同的数字内存地址相同
布尔值：
- 相同的内存地址相同

这就是我们为什么在pycharm中测试的时候都是True，我们现在去终端上测试一下数字的范围

当代码块和小数据池两个在一起，先执行代码块

我们知道了代码块支持的数据类型和支持怎样的操作，现在来看看小数据池的支持数据类型和范围：

小数据支持：

字符串：
- 纯字母和数字的时候长度任意，内存地址相同。
- Python36纯字母和数字乘法总长度 <= 20 内存地址相同。
- Python37纯字母和数字乘法总长度 <= 4096 内存地址相同。
- 中文和特殊符号乘法的时候只能乘以 0 内存地址相同
数字：
- -5 ～ 256
布尔值：
- True
- False

小数据池和代码块都是Python内置的,咱们开发的时候不使用,他们统称为驻留机制,有了小数据池和代码块能够提升Python的效率

三.运算符

计算机可以进行的运算有很多种，可不只加减乘除这么简单，运算按种类可分为算数运算、比较运算、逻辑运算、赋值运算、成员运算、身份运算、位运算.

今天我们暂只学习算数运算、比较运算、逻辑运算、赋值运算、成员运算

1.1 算数运算

以下假设变量：a=10，b=20

1.2 比较运算

以下假设变量：a=10，b=20

1.3 赋值运算

以下假设变量：a=10，b=20

1.4 逻辑运算

针对逻辑运算的进一步研究：

在没有()的情况下not 优先级高于 and，and优先级高于or，即优先级关系为( )>not>and>or，同一优先级从左往右计算。

例题：

判断下列逻辑语句的True，False。

x or y , x为真，值就是x，x为假，值是y；

x and y, x为真，值是y,x为假，值是x。

3>4 or 4<3 and 1==1
1 < 2 and 3 < 4 or 1>2 
2 > 1 and 3 < 4 or 4 > 5 and 2 < 1
not 2 > 1 and 3 < 4 or 4 > 5 and 2 > 1 and 9 > 8 or 7 < 6

例题：求出下列逻辑语句的值。

8 or 4
0 and 3
0 or 4 and 3 or 7 or 9 and 6

1.5 成员运算

in not in :

判断子元素是否在原字符串（字典，列表，集合）中：

例如：

#print('喜欢' in 'dkfljadklf喜欢hfjdkas')
#print('a' in 'bcvd')
#print('y' not in 'ofkjdslaf')

四.格式化输出

现在需要我们录入我们身边好友的信息,格式如下:

------------ info of Alex Li ----------
             Name  : Alex Li
             Age   : 22
             job   : Teacher 
             Hobbie: girl
    ------------- end ----------------

我们现在能想到的办法就是用一下方法:

name = input('请输入姓名:')
age = input('请输入年龄:')
job = input('请输入职业:')
hobby = input('请输入爱好:')
a = '------------ info of Alex Li ----------'
b = 'Name:'
c = 'Age:'
d = 'Job:'
e = 'Hobby:'
f = '------------- end ----------------'
print(a+'
'+b+name+'
'+c+age+'
'+d+job+'
'+e+hobby+'
'+f)

# 运行结果
------------ info of Alex Li ----------
Name:meet
Age:18
Job:it
Hobby:3
------------- end ----------------

这样写完全没有问题,但是会不会比较繁琐呢,有些大佬肯定会想这不都实现了吗,还逼叨逼什么啊,那是因为没有体验过格式化输出有多霸道,我们现在来体验下霸道的姿势

1.1 %s — 字符串类型

name = input('请输入姓名:')
age = input('请输入年龄:')
job = input('请输入职业:')
hobby = input('请输入爱好:')
msg = '''
------------ info of Alex Li ----------
Name  : %s
Age   : %s 
job   : %s 
Hobbie: %s 
------------- end ----------------

'''
print(msg%(name,age,job,hobby))

我们但从代码的数量来看,这样就比那样的少,看到这里有细心的老铁们肯定在想%s这是啥玩意?

% 是一个占位, 回想下我们小时候给朋友占位子的场景,是的这个就是占位.那s又是什么呢? s代码的字符串类型;

1.2 %d|%i — 数字类型

name = input('>>>')
s1 = '1234%d'%int(name)
s2 = '1234%i'%int(name)
print(s1)
print(s2)

结果:
>>>89
123489
123489
# %d和%i这种格式化只能用数字来填补占位

1.3 %% — 转义

num = input('>>>')
s= '目前学习进度:%s%%'%num
print(s)

结果:
>>>80
目前学习进度:80%

# 如果我们字符串中想要显示单独的%就需要用来个%%来转义,不然程序会认为那是一个占位

五.数据补充

我们前期的时候和大家说了,有些方法我们放在数据类型补充的这一天中,我们今天将前面没有讲解的内容,都一起讲解了,就先从str开始

str:

1.1 首字母大写

name = "meet"
name.capitalize()

1.2 每个单词的首字母大写

name = "meet"
name.title()

1.3 大小写反转

name = "meet"
name.swapcase()

1.4 统计

name = "meet"
name.count()

1.5 查找

name = "meet"
name.find()  # 当查找的时候数据不存在返回-1

name = "meet"
name.index() # 当查找的时候数据不存在报错

1.6 居中

name = "meet"
name.center(20) # 居中一共占用20个位置

1.7 填充

name = "meet{},{},{}"
name1 = name.format("郭宝元","宝帅","宝哥")  # 按照位置顺序填充
print(name1)

name = "meet{0},{1},{2}"
name2 = name.format("宝帅","宝哥","郭宝元")  # 按照下标填充
print(name2)

name = "meet{a},{c},{b}"
name3 = name.format(a="郭宝元",b="宝帅",c="宝哥") # 按照关键字填充
print(name3)

1.8 拼接将可迭代容器转换成字符串字典拼接的是键

可迭代容器中的元素必须是字符串类型

lst = ["2","3","4","5"]
print('*'.join(lst))

tu = ("2","3","4","5")
print('*'.join(tu))

dic = {"key1":2,"key2":4}
print('*'.join(dic))

se = {"1","3","34"}
print('*'.join(se))

字符+

name1 = "alex"
name2 = "wusir"
print(id(name1))
print(id(name2))
print(id(name1 + name2))

字符*

name1 = "alex"
print(id(name1))
print(id(name1 * 5))

字符 + 和 * 都是开辟新的空间

list:

1.1 反转

lst = [1,2,3,4,5]
lst.reverse()

1.2 排序

lst = [1,2,3,4,5]
lst.sort()  # 升序
lst.sort(reverse=True)  # 降序

1.3 查找

lst = [1,2,3,4,5]
lst.index(3) # 存在就返回索引,不存在就报错

1.4 统计

lst = [1,23,4,5,6,]
lst.count(23) # 统计23出现的次数

list +

lis = [1,2,3]
lst1 = [4,5,6]
print(id(lis))
print(id(lst1))
print(id(lis + lst1))

list *

lst = [1,2,3]
print(lst * 5)
print(id(lst))
print(id(lst * 5))

面试题:

lst = [[]]
new_lst = lst * 5
new_lst[0].append(1)
print(new_lst)

列表在进行乘法的时候元素都是共用

tuple:

面试题:

tu = (1)  # 获取的括号中元素的本身
tu = (1,2)# 获取的是元组
tu = (1,) # 获取的是元组

列表能够支持+, 元组也可以支持+,

+

tu = (1,2)
tu1 = (3,4)
tu2 = tu + tu1
print(id(tu))
print(id(tu1))
print(id(tu2))

*

tu = ([],)
tu1 = tu * 5
tu1[0].append(9)
print(tu1)

列表在进行乘法的时候元素都是共用

tu = (1,2)
tu1 = tu * 5
print(tu1)
print(id(tu1[0]),id(tu1[-2]))

dict:

字典定义方式:

dict(key=1,key1=2,key2=3)

1.1 随机删除

dic = {"key":"value","key2":"value2"}
dic.popitem()  # 随机删除

此处说明一下,官方文档中表示是随机删除一个键值对中,但是我们实际测试的时候

都是删除字典中最后的一个键值对,这也是一个Python36中目前存在的一个bug

1.2 批量创建字典

dic = {}
dic1 = dic.fromkeys("abc",[1,2])
print(dic1)

formkeys这个是个坑,坑点就在于值是可变数据类型的时候,当第一个键对应的值进行修改了以后,其余的键对应的值也都跟着进行改变了. 如何避免坑,就是批量创建字典的时候值不能使用可变的数据类型.

set:

集合定义方式:

set("12345")
{1,2,3,4,5} # 将字符串进行迭代添加

最后我们对我们学习的这些数据类型进行一个总结,我们按照有序,无序,可变,不可变,取值方式来总结

有序:
- 数字
- 字符串
- 列表
- 元组
无序:
- 字典
- 集合
可变数据类型:
- 列表
- 字典
- 集合
不可变数据类型:
- 字符串
- 数字
- 元组
取值顺序:
- 直接取值 — 数字,布尔值,集合
- 顺序取值(索引) — 列表,元组,字符串
- 通过键取值 — 字典

类型转换

元组 => 列表   list(tuple)
列表 => 元组   tuple(list)
列表 => 字符串 str.join(list)
字符串 => 列表 str.split()

转换成False的数据:
0,'',None,[],(),{},set() 都是False

六.二次编码

编码回顾:

ASCII : 最早的编码. ⾥⾯有英⽂⼤写字⺟, ⼩写字⺟, 数字, ⼀些特殊字符. 没有中⽂, 8个01代码, 8个bit, 1个byte

GBK: 中⽂国标码, ⾥⾯包含了ASCII编码和中⽂常⽤编码. 16个bit, 2个byte

UNICODE: 万国码, ⾥⾯包含了全世界所有国家⽂字的编码. 32个bit, 4个byte, 包含了 ASCII

UTF-8: 可变⻓度的万国码. 是unicode的⼀种实现. 最⼩字符占8位　　1.英⽂: 8bit 1byte 　　2.欧洲⽂字:16bit 2byte 　　3.中⽂:24bit 3byte

综上, 除了ASCII码以外, 其他信息不能直接转换. 在python3的内存中. 在程序运⾏阶段. 使⽤的是unicode编码. 因为unicode是万国码. 什么内容都可以进⾏显⽰. 那么在数据传输和存储的时候由于unicode比较浪费空间和资源. 需要把 unicode转存成UTF-8或者GBK进⾏存储. 怎么转换呢. 在python中可以把⽂字信息进⾏编码. 编码之后的内容就可以进⾏传输了. 编码之后的数据是bytes类型的数据.其实啊. 还是原来的数据只是经过编码之后表现形式发⽣了改变⽽已.

bytes的表现形式:

英⽂ b'alex' 英⽂的表现形式和字符串没什么两样
中⽂ b'xe4xb8xad' 这是⼀个汉字的UTF-8的bytes表现形式

1.1 编码

s = "alex"
print(s.encode("utf-8")) # 将字符串编码成UTF-8
print(s.encode("GBK")) # 将字符串编码成GBK
结果:
b'alex'
b'alex'
s = "中"
print(s.encode("UTF-8")) # 中⽂编码成UTF-8
print(s.encode("GBK")) # 中⽂编码成GBK
结果:
b'xe4xb8xad'
b'xd6xd0'

记住: 英⽂编码之后的结果和源字符串⼀致. 中⽂编码之后的结果根据编码的不同. 编码结果也不同. 　　我们能看到. ⼀个中⽂的UTF-8编码是3个字节. ⼀个GBK的中⽂编码是2个字节. 　　编码之后的类型就是bytes类型. 在⽹络传输和存储的时候我们python是发送和存储的bytes 类型. 　　那么在对⽅接收的时候. 也是接收的bytes类型的数据. 我们可以使⽤decode()来进⾏解码操作. 　　把bytes类型的数据还原回我们熟悉的字符串:

s = "我叫李嘉诚"
print(s.encode("utf-8")) #
b'xe6x88x91xe5x8fxabxe6x9dx8exe5x98x89xe8xafx9a'
print(b'xe6x88x91xe5x8fxabxe6x9dx8exe5x98x89xe8xafx9a'.decod
e("utf-8")) # 解码

1.2 解码

编码和解码的时候都需要制定编码格式.

s = "我是⽂字" bs = s.encode("GBK") 
# 我们这样可以获取到GBK的⽂字 
# 把GBK转换成UTF-8 
# ⾸先要把GBK转换成unicode. 也就是需要解码 
s = bs.decode("GBK") # 解码 
# 然后需要进⾏重新编码成UTF-8 
bss = s.encode("UTF-8") # 重新编码 
print(bss)

unicode就是一个桥梁,可以实现他们之前相互编码,但是我们在编码和解码的时候必须使用同一个密码本.

七.以后要遇到的坑

1.1 循环添加

lst = [1,2,3,4,5,6]
for i in lst:
    lst.append(7) # 这样写法就会一直持续添加7
    print(lst)
print(lst)

1.2 列表循环删除错误实例

列表: 循环删除列表中的每⼀个元素

li = [11, 22, 33, 44]
for e in li:
    li.remove(e)
print(li)
结果:
[22, 44]

分析原因: for的运⾏过程. 会有⼀个指针来记录当前循环的元素是哪⼀个, ⼀开始这个指针指向第0 个.

然后获取到第0个元素. 紧接着删除第0个. 这个时候. 原来是第⼀个的元素会⾃动的变成第0个.

然后指针向后移动⼀次, 指向1元素. 这时原来的1已经变成了0, 也就不会被删除了.

li = [11, 22, 33, 44]
for i in range(0, len(li)):
    del li[i]
print(li)
结果: 报错
# 删除的时候li[0] 被删除之后. 后⾯⼀个就变成了第0个.
# 以此类推. 当i = 2的时候. list中只有⼀个元素. 但是这个时候删除的是第2个 肯定报错啊

经过分析发现. 循环删除都不⾏. 不论是⽤del还是⽤remove. 都不能实现. 那么pop呢?

用pop删除试一试

for el in li:
 li.pop() # pop也不⾏
print(li)
结果:
[11, 22]

1.3 列表循环删除成功

只有这样才是可以的:

for i in range(0, len(li)): # 循环len(li)次, 然后从后往前删除
 li.pop()
print(li)
或者. ⽤另⼀个列表来记录你要删除的内容. 然后循环删除

li = [11, 22, 33, 44]
del_li = []
for e in li:
 del_li.append(e)
for e in del_li:
 li.remove(e)
print(li)

li = [1,2,3,4]
lst = li[:]
for i in lst:
    li.remove(i)
print(li)

注意: 由于删除元素会导致元素的索引改变, 所以容易出现问题. 尽量不要再循环中直接去删除元素. 可以把要删除的元素添加到另⼀个容器中然后再批量删除.

1.4 字典的坑

dict中的fromkey(),再次重提可以帮我们通过list来创建⼀个dict

dic = dict.fromkeys(["jay", "JJ"], ["周杰伦", "麻花藤"])
print(dic)
结果:
{'jay': ['周杰伦', '麻花藤'], 'JJ': ['周杰伦', '麻花藤']}

代码中只是更改了jay那个列表. 但是由于jay和JJ⽤的是同⼀个列表. 所以. 前⾯那个改了. 后面那个也会跟着改　

1.5 字典在循环时不能修改数据的大小

dict中的元素在迭代过程中是不允许进⾏添加和删除的

dic = {'k1': 'alex', 'k2': 'wusir', 'k3': '大宝哥'}
# 删除key中带有'k'的元素
for k in dic:
  if 'k' in k:
 del dic[k] # dictionary changed size during iteration, 在循环迭
代的时候不允许进⾏删除操作
print(dic)

那怎么办呢? 把要删除的元素暂时先保存在⼀个list中, 然后循环list, 再删除

dic = {'k1': 'alex', 'k2': 'wusir', 'k3': '大宝哥'}
dic_del_list = []
# 删除key中带有'k'的元素
for k in dic:
     if 'k' in k:
     dic_del_list.append(k)

for el in dic_del_list:
     del dic[el]
print(dic)

# 使用两个字典进行删除
dic = {'k1': 'alex', 'k2': 'wusir', 'k3': '大宝哥'}
dic1 = dic.copy()
for i in dic1:
    dic.pop(i)
print(dic)

集合在循环时不能修改数据的大小

set1 = {1,2,3,4,5,6}
for i in set1:
    set1.pop()
print(set1)

Traceback (most recent call last):
  File "/python项目/m2.py", line 224, in <module>
    for i in set1:
RuntimeError: Set changed size during iteration

成功进行删除

set1 = {1,2,3,4,5,6}
set2 = set1.copy()
for i in set2:
    set1.remove(i)
print(set1)

1.6 类型转换

元组 => 列表 list(tuple)
列表 => 元组 tuple(list)
list=>str str.join(list)
str=>list str.split()

转换成False的数据:
0,'',None,[],(),{},set() ==> False