bn/asm/x86_64-mont5.pl: fix carry bug in bn_sqr8x_internal.

[openssl.git] / crypto / bn / asm / x86_64-mont5.pl
diff --git a/crypto/bn/asm/x86_64-mont5.pl b/crypto/bn/asm/x86_64-mont5.pl

index be91ef09d58dc9215d8ff78877d5d93419f0bc27..d041d738cfd5e3f49eae6d16274aa7af2b315de1 100755 (executable)
--- a/crypto/bn/asm/x86_64-mont5.pl
+++ b/crypto/bn/asm/x86_64-mont5.pl
@@ -1,4 +1,11 @@
-#!/usr/bin/env perl
+#! /usr/bin/env perl
+# Copyright 2011-2016 The OpenSSL Project Authors. All Rights Reserved.
+#
+# Licensed under the OpenSSL license (the "License").  You may not use
+# this file except in compliance with the License.  You can obtain a copy
+# in the file LICENSE in the source distribution or at
+# https://www.openssl.org/source/license.html
+
  
  # ====================================================================
  # Written by Andy Polyakov <appro@openssl.org> for the OpenSSL
@@ -35,7 +42,7 @@ $0 =~ m/(.*[\/\\])[^\/\\]+$/; $dir=$1;
  ( $xlate="${dir}../../perlasm/x86_64-xlate.pl" and -f $xlate) or
  die "can't locate x86_64-xlate.pl";
  
-open OUT,"| \"$^X\" $xlate $flavour $output";
+open OUT,"| \"$^X\" \"$xlate\" $flavour \"$output\"";
  *STDOUT=*OUT;
  
  if (`$ENV{CC} -Wa,-v -c -o /dev/null -x assembler /dev/null 2>&1`
@@ -86,6 +93,8 @@ $code=<<___;
  .type  bn_mul_mont_gather5,\@function,6
  .align 64
  bn_mul_mont_gather5:
+       mov     ${num}d,${num}d
+       mov     %rsp,%rax
         test    \$7,${num}d
         jnz     .Lmul_enter
  ___
@@ -97,95 +106,136 @@ $code.=<<___;
  
  .align 16
  .Lmul_enter:
-       mov     ${num}d,${num}d
-       mov     %rsp,%rax
-       movd    `($win64?56:8)`(%rsp),%xmm0     # load 7th argument
-       lea     .Lmagic_masks(%rip),%r10
+       movd    `($win64?56:8)`(%rsp),%xmm5     # load 7th argument
         push    %rbx
         push    %rbp
         push    %r12
         push    %r13
         push    %r14
         push    %r15
-___
-$code.=<<___ if ($win64);
-       lea     -0x38(%rsp),%rsp
-       movaps  %xmm6,(%rsp)
-       movaps  %xmm7,0x10(%rsp)
-       movaps  %xmm8,0x20(%rsp)
-___
-$code.=<<___;
-       lea     2($num),%r11
-       neg     %r11
-       lea     (%rsp,%r11,8),%rsp      # tp=alloca(8*(num+2))
-       and     \$-1024,%rsp            # minimize TLB usage
  
+       neg     $num
+       mov     %rsp,%r11
+       lea     -280(%rsp,$num,8),%r10  # future alloca(8*(num+2)+256+8)
+       neg     $num                    # restore $num
+       and     \$-1024,%r10            # minimize TLB usage
+
+       # An OS-agnostic version of __chkstk.
+       #
+       # Some OSes (Windows) insist on stack being "wired" to
+       # physical memory in strictly sequential manner, i.e. if stack
+       # allocation spans two pages, then reference to farmost one can
+       # be punishable by SEGV. But page walking can do good even on
+       # other OSes, because it guarantees that villain thread hits
+       # the guard page before it can make damage to innocent one...
+       sub     %r10,%r11
+       and     \$-4096,%r11
+       lea     (%r10,%r11),%rsp
+       mov     (%rsp),%r11
+       cmp     %r10,%rsp
+       ja      .Lmul_page_walk
+       jmp     .Lmul_page_walk_done
+
+.Lmul_page_walk:
+       lea     -4096(%rsp),%rsp
+       mov     (%rsp),%r11
+       cmp     %r10,%rsp
+       ja      .Lmul_page_walk
+.Lmul_page_walk_done:
+
+       lea     .Linc(%rip),%r10
         mov     %rax,8(%rsp,$num,8)     # tp[num+1]=%rsp
  .Lmul_body:
+
         lea     128($bp),%r12           # reassign $bp (+size optimization)
  ___
                 $bp="%r12";
                 $STRIDE=2**5*8;         # 5 is "window size"
                 $N=$STRIDE/4;           # should match cache line size
  $code.=<<___;
-       ################################################################
-       # calculate mask: one of %xmm4..7 will contain 0xff..00 or
-       # 0x00..ff denoting which half of a quarter of corresponding
-       # cache line is significant.
-       #
-       movq    56(%r10),%xmm1          # 0b11001
-       movq    %xmm0,%rdx
-       pand    %xmm1,%xmm0
-       movdqa  0(%r10),%xmm4
-       pshufd  \$0,%xmm0,%xmm0         # broadcast masked index
-       movdqa  16(%r10),%xmm5
-       movdqa  32(%r10),%xmm6
-       pcmpeqd %xmm0,%xmm4
-       movdqa  48(%r10),%xmm7
-       pcmpeqd %xmm0,%xmm5
-       pcmpeqd %xmm0,%xmm6
-       pcmpeqd %xmm0,%xmm7
-
-       ################################################################
-       # calculate index in 1st cache line, but in such manner that
-       # if target data is in another cache line, then relevant
-       # "rotating" reference would land on it...
-       #
-       shr     \$1,%rdx                # idx/=2
-       mov     %rdx,$j
-       shr     \$2,%rdx
-       sub     %rdx,$j
-       and     \$3,$j                  # (idx-idx/4)%4
-       shl     \$4,$j                  # scale for xmm references
-
-       ################################################################
-       # "rotating" references are touching different cache banks in
-       # different cache lines, so that not only all cache lines are
-       # referred in each iteration, but even all cache banks.
-       #
-       lea     16($j),$m0
-       lea     32($j),$m1
-       and     \$63,$m0
-       lea     48($j),%rdx
-       and     \$63,$m1
-       and     \$63,%rdx
-       movdqa  `0*$STRIDE/4-128`($bp,$j),%xmm0
-       movdqa  `1*$STRIDE/4-128`($bp,$m0),%xmm1
-       movdqa  `2*$STRIDE/4-128`($bp,$m1),%xmm2
-       movdqa  `3*$STRIDE/4-128`($bp,%rdx),%xmm3
-       pand    %xmm4,%xmm0
-       pand    %xmm5,%xmm1
-       pand    %xmm6,%xmm2
-       por     %xmm1,%xmm0
-       pand    %xmm7,%xmm3
-       por     %xmm2,%xmm0
-       lea     $STRIDE($bp),$bp
-       por     %xmm3,%xmm0
-       movq    $j,%xmm8
+       movdqa  0(%r10),%xmm0           # 00000001000000010000000000000000
+       movdqa  16(%r10),%xmm1          # 00000002000000020000000200000002
+       lea     24-112(%rsp,$num,8),%r10# place the mask after tp[num+3] (+ICache optimization)
+       and     \$-16,%r10
  
-       pshufd  \$0x4e,%xmm0,%xmm1
-       por     %xmm1,%xmm0             # merge upper and lower halves
+       pshufd  \$0,%xmm5,%xmm5         # broadcast index
+       movdqa  %xmm1,%xmm4
+       movdqa  %xmm1,%xmm2
+___
+########################################################################
+# calculate mask by comparing 0..31 to index and save result to stack
+#
+$code.=<<___;
+       paddd   %xmm0,%xmm1
+       pcmpeqd %xmm5,%xmm0             # compare to 1,0
+       .byte   0x67
+       movdqa  %xmm4,%xmm3
+___
+for($k=0;$k<$STRIDE/16-4;$k+=4) {
+$code.=<<___;
+       paddd   %xmm1,%xmm2
+       pcmpeqd %xmm5,%xmm1             # compare to 3,2
+       movdqa  %xmm0,`16*($k+0)+112`(%r10)
+       movdqa  %xmm4,%xmm0
  
+       paddd   %xmm2,%xmm3
+       pcmpeqd %xmm5,%xmm2             # compare to 5,4
+       movdqa  %xmm1,`16*($k+1)+112`(%r10)
+       movdqa  %xmm4,%xmm1
+
+       paddd   %xmm3,%xmm0
+       pcmpeqd %xmm5,%xmm3             # compare to 7,6
+       movdqa  %xmm2,`16*($k+2)+112`(%r10)
+       movdqa  %xmm4,%xmm2
+
+       paddd   %xmm0,%xmm1
+       pcmpeqd %xmm5,%xmm0
+       movdqa  %xmm3,`16*($k+3)+112`(%r10)
+       movdqa  %xmm4,%xmm3
+___
+}
+$code.=<<___;                          # last iteration can be optimized
+       paddd   %xmm1,%xmm2
+       pcmpeqd %xmm5,%xmm1
+       movdqa  %xmm0,`16*($k+0)+112`(%r10)
+
+       paddd   %xmm2,%xmm3
+       .byte   0x67
+       pcmpeqd %xmm5,%xmm2
+       movdqa  %xmm1,`16*($k+1)+112`(%r10)
+
+       pcmpeqd %xmm5,%xmm3
+       movdqa  %xmm2,`16*($k+2)+112`(%r10)
+       pand    `16*($k+0)-128`($bp),%xmm0      # while it's still in register
+
+       pand    `16*($k+1)-128`($bp),%xmm1
+       pand    `16*($k+2)-128`($bp),%xmm2
+       movdqa  %xmm3,`16*($k+3)+112`(%r10)
+       pand    `16*($k+3)-128`($bp),%xmm3
+       por     %xmm2,%xmm0
+       por     %xmm3,%xmm1
+___
+for($k=0;$k<$STRIDE/16-4;$k+=4) {
+$code.=<<___;
+       movdqa  `16*($k+0)-128`($bp),%xmm4
+       movdqa  `16*($k+1)-128`($bp),%xmm5
+       movdqa  `16*($k+2)-128`($bp),%xmm2
+       pand    `16*($k+0)+112`(%r10),%xmm4
+       movdqa  `16*($k+3)-128`($bp),%xmm3
+       pand    `16*($k+1)+112`(%r10),%xmm5
+       por     %xmm4,%xmm0
+       pand    `16*($k+2)+112`(%r10),%xmm2
+       por     %xmm5,%xmm1
+       pand    `16*($k+3)+112`(%r10),%xmm3
+       por     %xmm2,%xmm0
+       por     %xmm3,%xmm1
+___
+}
+$code.=<<___;
+       por     %xmm1,%xmm0
+       pshufd  \$0x4e,%xmm0,%xmm1
+       por     %xmm1,%xmm0
+       lea     $STRIDE($bp),$bp
         movq    %xmm0,$m0               # m0=bp[0]
  
         mov     ($n0),$n0               # pull n0[0] value
@@ -232,15 +282,14 @@ $code.=<<___;
  
         mulq    $m1                     # np[j]*m1
         cmp     $num,$j
-       jne     .L1st
-
-       movq    %xmm8,$j
+       jne     .L1st                   # note that upon exit $j==$num, so
+                                       # they can be used interchangeably
  
         add     %rax,$hi1
         adc     \$0,%rdx
         add     $hi0,$hi1               # np[j]*m1+ap[j]*bp[0]
         adc     \$0,%rdx
-       mov     $hi1,-16(%rsp,$num,8)   # tp[j-1]
+       mov     $hi1,-16(%rsp,$num,8)   # tp[num-1]
         mov     %rdx,$hi1
         mov     $lo0,$hi0
  
@@ -254,27 +303,32 @@ $code.=<<___;
         jmp     .Louter
  .align 16
  .Louter:
-       lea     16($j),$m0
-       lea     32($j),$m1
-       and     \$63,$m0
-       lea     48($j),%rdx
-       and     \$63,$m1
-       and     \$63,%rdx
-       movdqa  `0*$STRIDE/4-128`($bp,$j),%xmm0
-       movdqa  `1*$STRIDE/4-128`($bp,$m0),%xmm1
-       movdqa  `2*$STRIDE/4-128`($bp,$m1),%xmm2
-       movdqa  `3*$STRIDE/4-128`($bp,%rdx),%xmm3
-       pand    %xmm4,%xmm0
-       pand    %xmm5,%xmm1
-       pand    %xmm6,%xmm2
-       por     %xmm1,%xmm0
-       pand    %xmm7,%xmm3
-       por     %xmm2,%xmm0
+       lea     24+128(%rsp,$num,8),%rdx        # where 256-byte mask is (+size optimization)
+       and     \$-16,%rdx
+       pxor    %xmm4,%xmm4
+       pxor    %xmm5,%xmm5
+___
+for($k=0;$k<$STRIDE/16;$k+=4) {
+$code.=<<___;
+       movdqa  `16*($k+0)-128`($bp),%xmm0
+       movdqa  `16*($k+1)-128`($bp),%xmm1
+       movdqa  `16*($k+2)-128`($bp),%xmm2
+       movdqa  `16*($k+3)-128`($bp),%xmm3
+       pand    `16*($k+0)-128`(%rdx),%xmm0
+       pand    `16*($k+1)-128`(%rdx),%xmm1
+       por     %xmm0,%xmm4
+       pand    `16*($k+2)-128`(%rdx),%xmm2
+       por     %xmm1,%xmm5
+       pand    `16*($k+3)-128`(%rdx),%xmm3
+       por     %xmm2,%xmm4
+       por     %xmm3,%xmm5
+___
+}
+$code.=<<___;
+       por     %xmm5,%xmm4
+       pshufd  \$0x4e,%xmm4,%xmm0
+       por     %xmm4,%xmm0
         lea     $STRIDE($bp),$bp
-       por     %xmm3,%xmm0
-
-       pshufd  \$0x4e,%xmm0,%xmm1
-       por     %xmm1,%xmm0             # merge upper and lower halves
  
         mov     ($ap),%rax              # ap[0]
         movq    %xmm0,$m0               # m0=bp[i]
@@ -324,16 +378,14 @@ $code.=<<___;
  
         mulq    $m1                     # np[j]*m1
         cmp     $num,$j
-       jne     .Linner
-
-       movq    %xmm8,$j
-
+       jne     .Linner                 # note that upon exit $j==$num, so
+                                       # they can be used interchangeably
         add     %rax,$hi1
         adc     \$0,%rdx
         add     $lo0,$hi1               # np[j]*m1+ap[j]*bp[i]+tp[j]
         mov     (%rsp,$num,8),$lo0
         adc     \$0,%rdx
-       mov     $hi1,-16(%rsp,$num,8)   # tp[j-1]
+       mov     $hi1,-16(%rsp,$num,8)   # tp[num-1]
         mov     %rdx,$hi1
  
         xor     %rdx,%rdx
@@ -380,13 +432,7 @@ $code.=<<___;
  
         mov     8(%rsp,$num,8),%rsi     # restore %rsp
         mov     \$1,%rax
-___
-$code.=<<___ if ($win64);
-       movaps  -104(%rsi),%xmm6
-       movaps  -88(%rsi),%xmm7
-       movaps  -72(%rsi),%xmm8
-___
-$code.=<<___;
+
         mov     -48(%rsi),%r15
         mov     -40(%rsi),%r14
         mov     -32(%rsi),%r13
@@ -405,6 +451,8 @@ $code.=<<___;
  .type  bn_mul4x_mont_gather5,\@function,6
  .align 32
  bn_mul4x_mont_gather5:
+       .byte   0x67
+       mov     %rsp,%rax
  .Lmul4x_enter:
  ___
  $code.=<<___ if ($addx);
@@ -413,14 +461,13 @@ $code.=<<___ if ($addx);
         je      .Lmulx4x_enter
  ___
  $code.=<<___;
-       .byte   0x67
-       mov     %rsp,%rax
         push    %rbx
         push    %rbp
         push    %r12
         push    %r13
         push    %r14
         push    %r15
+.Lmul4x_prologue:
  
         .byte   0x67
         shl     \$3,${num}d             # convert $num to bytes
@@ -437,24 +484,41 @@ $code.=<<___;
         # calculated from 7th argument, the index.]
         #
         lea     -320(%rsp,$num,2),%r11
+       mov     %rsp,%rbp
         sub     $rp,%r11
         and     \$4095,%r11
         cmp     %r11,%r10
         jb      .Lmul4xsp_alt
-       sub     %r11,%rsp               # align with $rp
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*num*8+256)
+       sub     %r11,%rbp               # align with $rp
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*num*8+256)
         jmp     .Lmul4xsp_done
  
  .align 32
  .Lmul4xsp_alt:
         lea     4096-320(,$num,2),%r10
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*num*8+256)
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*num*8+256)
         sub     %r10,%r11
         mov     \$0,%r10
         cmovc   %r10,%r11
-       sub     %r11,%rsp
+       sub     %r11,%rbp
  .Lmul4xsp_done:
-       and     \$-64,%rsp
+       and     \$-64,%rbp
+       mov     %rsp,%r11
+       sub     %rbp,%r11
+       and     \$-4096,%r11
+       lea     (%rbp,%r11),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lmul4x_page_walk
+       jmp     .Lmul4x_page_walk_done
+
+.Lmul4x_page_walk:
+       lea     -4096(%rsp),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lmul4x_page_walk
+.Lmul4x_page_walk_done:
+
         neg     $num
  
         mov     %rax,40(%rsp)
@@ -985,7 +1049,7 @@ my $bptr="%rdx";   # const void *table,
  my $nptr="%rcx";       # const BN_ULONG *nptr,
  my $n0  ="%r8";                # const BN_ULONG *n0);
  my $num ="%r9";                # int num, has to be divisible by 8
-                       # int pwr 
+                       # int pwr
  
  my ($i,$j,$tptr)=("%rbp","%rcx",$rptr);
  my @A0=("%r10","%r11");
@@ -997,6 +1061,7 @@ $code.=<<___;
  .type  bn_power5,\@function,6
  .align 32
  bn_power5:
+       mov     %rsp,%rax
  ___
  $code.=<<___ if ($addx);
         mov     OPENSSL_ia32cap_P+8(%rip),%r11d
@@ -1005,13 +1070,13 @@ $code.=<<___ if ($addx);
         je      .Lpowerx5_enter
  ___
  $code.=<<___;
-       mov     %rsp,%rax
         push    %rbx
         push    %rbp
         push    %r12
         push    %r13
         push    %r14
         push    %r15
+.Lpower5_prologue:
  
         shl     \$3,${num}d             # convert $num to bytes
         lea     ($num,$num,2),%r10d     # 3*$num
@@ -1026,25 +1091,42 @@ $code.=<<___;
         # calculated from 7th argument, the index.]
         #
         lea     -320(%rsp,$num,2),%r11
+       mov     %rsp,%rbp
         sub     $rptr,%r11
         and     \$4095,%r11
         cmp     %r11,%r10
         jb      .Lpwr_sp_alt
-       sub     %r11,%rsp               # align with $aptr
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*num*8+256)
+       sub     %r11,%rbp               # align with $aptr
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*num*8+256)
         jmp     .Lpwr_sp_done
  
  .align 32
  .Lpwr_sp_alt:
         lea     4096-320(,$num,2),%r10
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*num*8+256)
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*num*8+256)
         sub     %r10,%r11
         mov     \$0,%r10
         cmovc   %r10,%r11
-       sub     %r11,%rsp
+       sub     %r11,%rbp
  .Lpwr_sp_done:
-       and     \$-64,%rsp
-       mov     $num,%r10       
+       and     \$-64,%rbp
+       mov     %rsp,%r11
+       sub     %rbp,%r11
+       and     \$-4096,%r11
+       lea     (%rbp,%r11),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lpwr_page_walk
+       jmp     .Lpwr_page_walk_done
+
+.Lpwr_page_walk:
+       lea     -4096(%rsp),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lpwr_page_walk
+.Lpwr_page_walk_done:
+
+       mov     $num,%r10
         neg     $num
  
         ##############################################################
@@ -1065,10 +1147,15 @@ $code.=<<___;
         movq    $bptr,%xmm4
  
         call    __bn_sqr8x_internal
+       call    __bn_post4x_internal
         call    __bn_sqr8x_internal
+       call    __bn_post4x_internal
         call    __bn_sqr8x_internal
+       call    __bn_post4x_internal
         call    __bn_sqr8x_internal
+       call    __bn_post4x_internal
         call    __bn_sqr8x_internal
+       call    __bn_post4x_internal
  
         movq    %xmm2,$nptr
         movq    %xmm4,$bptr
@@ -1629,7 +1716,7 @@ my ($nptr,$tptr,$carry,$m0)=("%rbp","%rdi","%rsi","%rbx");
  
  $code.=<<___;
         movq    %xmm2,$nptr
-sqr8x_reduction:
+__bn_sqr8x_reduction:
         xor     %rax,%rax
         lea     ($nptr,$num),%rcx       # end of n[]
         lea     48+8(%rsp,$num,2),%rdx  # end of t[] buffer
@@ -1847,6 +1934,7 @@ sqr8x_reduction:
  
  .align 32
  .L8x_tail_done:
+       xor     %rax,%rax
         add     (%rdx),%r8              # can this overflow?
         adc     \$0,%r9
         adc     \$0,%r10
@@ -1854,10 +1942,8 @@ sqr8x_reduction:
         adc     \$0,%r12
         adc     \$0,%r13
         adc     \$0,%r14
-       adc     \$0,%r15                # can't overflow, because we
-                                       # started with "overhung" part
-                                       # of multiplication
-       xor     %rax,%rax
+       adc     \$0,%r15
+       adc     \$0,%rax
  
         neg     $carry
  .L8x_no_tail:
@@ -1888,6 +1974,8 @@ sqr8x_reduction:
  
         cmp     %rdx,$tptr              # end of t[]?
         jb      .L8x_reduction_loop
+       ret
+.size  bn_sqr8x_internal,.-bn_sqr8x_internal
  ___
  }\f
  ##############################################################
@@ -1896,13 +1984,12 @@ ___
  {
  my ($tptr,$nptr)=("%rbx","%rbp");
  $code.=<<___;
-       #xor    %rsi,%rsi               # %rsi was $carry above
+.type  __bn_post4x_internal,\@abi-omnipotent
+.align 32
+__bn_post4x_internal:
         mov     8*0($nptr),%r12
-       sub     %r15,%rcx               # compare top-most words
         lea     (%rdi,$num),$tptr       # %rdi was $tptr above
-       adc     %rsi,%rsi
         mov     $num,%rcx
-       or      %rsi,%rax
         movq    %xmm1,$rptr             # restore $rptr
         neg     %rax
         movq    %xmm1,$aptr             # prepare for back-to-back call
@@ -1946,14 +2033,13 @@ $code.=<<___;
  
         inc     %rcx                    # pass %cf
         jnz     .Lsqr4x_sub
-___
-}
-$code.=<<___;
+
         mov     $num,%r10               # prepare for back-to-back call
-       neg     $num                    # restore $num  
+       neg     $num                    # restore $num
         ret
-.size  bn_sqr8x_internal,.-bn_sqr8x_internal
+.size  __bn_post4x_internal,.-__bn_post4x_internal
  ___
+}
  {
  $code.=<<___;
  .globl bn_from_montgomery
@@ -1977,6 +2063,7 @@ bn_from_mont8x:
         push    %r13
         push    %r14
         push    %r15
+.Lfrom_prologue:
  
         shl     \$3,${num}d             # convert $num to bytes
         lea     ($num,$num,2),%r10      # 3*$num in bytes
@@ -1991,25 +2078,42 @@ bn_from_mont8x:
         # last operation, we use the opportunity to cleanse it.
         #
         lea     -320(%rsp,$num,2),%r11
+       mov     %rsp,%rbp
         sub     $rptr,%r11
         and     \$4095,%r11
         cmp     %r11,%r10
         jb      .Lfrom_sp_alt
-       sub     %r11,%rsp               # align with $aptr
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*$num*8+256)
+       sub     %r11,%rbp               # align with $aptr
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*$num*8+256)
         jmp     .Lfrom_sp_done
  
  .align 32
  .Lfrom_sp_alt:
         lea     4096-320(,$num,2),%r10
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*$num*8+256)
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*$num*8+256)
         sub     %r10,%r11
         mov     \$0,%r10
         cmovc   %r10,%r11
-       sub     %r11,%rsp
+       sub     %r11,%rbp
  .Lfrom_sp_done:
-       and     \$-64,%rsp
-       mov     $num,%r10       
+       and     \$-64,%rbp
+       mov     %rsp,%r11
+       sub     %rbp,%r11
+       and     \$-4096,%r11
+       lea     (%rbp,%r11),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lfrom_page_walk
+       jmp     .Lfrom_page_walk_done
+
+.Lfrom_page_walk:
+       lea     -4096(%rsp),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lfrom_page_walk
+.Lfrom_page_walk_done:
+
+       mov     $num,%r10
         neg     $num
  
         ##############################################################
@@ -2061,7 +2165,8 @@ $code.=<<___ if ($addx);
         jne     .Lfrom_mont_nox
  
         lea     (%rax,$num),$rptr
-       call    sqrx8x_reduction
+       call    __bn_sqrx8x_reduction
+       call    __bn_postx4x_internal
  
         pxor    %xmm0,%xmm0
         lea     48(%rsp),%rax
@@ -2072,7 +2177,8 @@ $code.=<<___ if ($addx);
  .Lfrom_mont_nox:
  ___
  $code.=<<___;
-       call    sqr8x_reduction
+       call    __bn_sqr8x_reduction
+       call    __bn_post4x_internal
  
         pxor    %xmm0,%xmm0
         lea     48(%rsp),%rax
@@ -2111,14 +2217,15 @@ $code.=<<___;
  .type  bn_mulx4x_mont_gather5,\@function,6
  .align 32
  bn_mulx4x_mont_gather5:
-.Lmulx4x_enter:
         mov     %rsp,%rax
+.Lmulx4x_enter:
         push    %rbx
         push    %rbp
         push    %r12
         push    %r13
         push    %r14
         push    %r15
+.Lmulx4x_prologue:
  
         shl     \$3,${num}d             # convert $num to bytes
         lea     ($num,$num,2),%r10      # 3*$num in bytes
@@ -2135,23 +2242,40 @@ bn_mulx4x_mont_gather5:
         # calculated from 7th argument, the index.]
         #
         lea     -320(%rsp,$num,2),%r11
+       mov     %rsp,%rbp
         sub     $rp,%r11
         and     \$4095,%r11
         cmp     %r11,%r10
         jb      .Lmulx4xsp_alt
-       sub     %r11,%rsp               # align with $aptr
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*$num*8+256)
+       sub     %r11,%rbp               # align with $aptr
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*$num*8+256)
         jmp     .Lmulx4xsp_done
  
  .Lmulx4xsp_alt:
         lea     4096-320(,$num,2),%r10
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*$num*8+256)
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*$num*8+256)
         sub     %r10,%r11
         mov     \$0,%r10
         cmovc   %r10,%r11
-       sub     %r11,%rsp
-.Lmulx4xsp_done:       
-       and     \$-64,%rsp              # ensure alignment
+       sub     %r11,%rbp
+.Lmulx4xsp_done:
+       and     \$-64,%rbp              # ensure alignment
+       mov     %rsp,%r11
+       sub     %rbp,%r11
+       and     \$-4096,%r11
+       lea     (%rbp,%r11),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lmulx4x_page_walk
+       jmp     .Lmulx4x_page_walk_done
+
+.Lmulx4x_page_walk:
+       lea     -4096(%rsp),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lmulx4x_page_walk
+.Lmulx4x_page_walk_done:
+
         ##############################################################
         # Stack layout
         # +0    -num
@@ -2558,14 +2682,15 @@ $code.=<<___;
  .type  bn_powerx5,\@function,6
  .align 32
  bn_powerx5:
-.Lpowerx5_enter:
         mov     %rsp,%rax
+.Lpowerx5_enter:
         push    %rbx
         push    %rbp
         push    %r12
         push    %r13
         push    %r14
         push    %r15
+.Lpowerx5_prologue:
  
         shl     \$3,${num}d             # convert $num to bytes
         lea     ($num,$num,2),%r10      # 3*$num in bytes
@@ -2580,25 +2705,42 @@ bn_powerx5:
         # calculated from 7th argument, the index.]
         #
         lea     -320(%rsp,$num,2),%r11
+       mov     %rsp,%rbp
         sub     $rptr,%r11
         and     \$4095,%r11
         cmp     %r11,%r10
         jb      .Lpwrx_sp_alt
-       sub     %r11,%rsp               # align with $aptr
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*$num*8+256)
+       sub     %r11,%rbp               # align with $aptr
+       lea     -320(%rbp,$num,2),%rbp  # future alloca(frame+2*$num*8+256)
         jmp     .Lpwrx_sp_done
  
  .align 32
  .Lpwrx_sp_alt:
         lea     4096-320(,$num,2),%r10
-       lea     -320(%rsp,$num,2),%rsp  # alloca(frame+2*$num*8+256)
+       lea     -320(%rbp,$num,2),%rbp  # alloca(frame+2*$num*8+256)
         sub     %r10,%r11
         mov     \$0,%r10
         cmovc   %r10,%r11
-       sub     %r11,%rsp
+       sub     %r11,%rbp
  .Lpwrx_sp_done:
-       and     \$-64,%rsp
-       mov     $num,%r10       
+       and     \$-64,%rbp
+       mov     %rsp,%r11
+       sub     %rbp,%r11
+       and     \$-4096,%r11
+       lea     (%rbp,%r11),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lpwrx_page_walk
+       jmp     .Lpwrx_page_walk_done
+
+.Lpwrx_page_walk:
+       lea     -4096(%rsp),%rsp
+       mov     (%rsp),%r10
+       cmp     %rbp,%rsp
+       ja      .Lpwrx_page_walk
+.Lpwrx_page_walk_done:
+
+       mov     $num,%r10
         neg     $num
  
         ##############################################################
@@ -2622,10 +2764,15 @@ bn_powerx5:
  .Lpowerx5_body:
  
         call    __bn_sqrx8x_internal
+       call    __bn_postx4x_internal
         call    __bn_sqrx8x_internal
+       call    __bn_postx4x_internal
         call    __bn_sqrx8x_internal
+       call    __bn_postx4x_internal
         call    __bn_sqrx8x_internal
+       call    __bn_postx4x_internal
         call    __bn_sqrx8x_internal
+       call    __bn_postx4x_internal
  
         mov     %r10,$num               # -num
         mov     $aptr,$rptr
@@ -3071,7 +3218,7 @@ my ($nptr,$carry,$m0)=("%rbp","%rsi","%rdx");
  
  $code.=<<___;
         movq    %xmm2,$nptr
-sqrx8x_reduction:
+__bn_sqrx8x_reduction:
         xor     %eax,%eax               # initial top-most carry bit
         mov     32+8(%rsp),%rbx         # n0
         mov     48+8(%rsp),%rdx         # "%r8", 8*0($tptr)
@@ -3236,6 +3383,7 @@ sqrx8x_reduction:
  
  .align 32
  .Lsqrx8x_tail_done:
+       xor     %rax,%rax
         add     24+8(%rsp),%r8          # can this overflow?
         adc     \$0,%r9
         adc     \$0,%r10
@@ -3243,10 +3391,8 @@ sqrx8x_reduction:
         adc     \$0,%r12
         adc     \$0,%r13
         adc     \$0,%r14
-       adc     \$0,%r15                # can't overflow, because we
-                                       # started with "overhung" part
-                                       # of multiplication
-       mov     $carry,%rax             # xor   %rax,%rax
+       adc     \$0,%r15
+       adc     \$0,%rax
  
         sub     16+8(%rsp),$carry       # mov 16(%rsp),%cf
  .Lsqrx8x_no_tail:                      # %cf is 0 if jumped here
@@ -3261,7 +3407,7 @@ sqrx8x_reduction:
         adc     8*5($tptr),%r13
         adc     8*6($tptr),%r14
         adc     8*7($tptr),%r15
-       adc     %rax,%rax               # top-most carry
+       adc     \$0,%rax                # top-most carry
  
         mov     32+8(%rsp),%rbx         # n0
         mov     8*8($tptr,%rcx),%rdx    # modulo-scheduled "%r8"
@@ -3279,6 +3425,8 @@ sqrx8x_reduction:
         lea     8*8($tptr,%rcx),$tptr   # start of current t[] window
         cmp     8+8(%rsp),%r8           # end of t[]?
         jb      .Lsqrx8x_reduction_loop
+       ret
+.size  bn_sqrx8x_internal,.-bn_sqrx8x_internal
  ___
  }\f
  ##############################################################
@@ -3286,15 +3434,11 @@ ___
  #
  {
  my ($rptr,$nptr)=("%rdx","%rbp");
-my @ri=map("%r$_",(10..13));
-my @ni=map("%r$_",(14..15));
  $code.=<<___;
+.align 32
+__bn_postx4x_internal:
         mov     8*0($nptr),%r12
-       xor     %ebx,%ebx
-       sub     %r15,%rsi               # compare top-most words
-       adc     %rbx,%rbx
         mov     %rcx,%r10               # -$num
-       or      %rbx,%rax
         mov     %rcx,%r9                # -$num
         neg     %rax
         sar     \$3+2,%rcx
@@ -3308,6 +3452,7 @@ $code.=<<___;
         mov     8*3($nptr),%r15
         jmp     .Lsqrx4x_sub_entry
  
+.align 16
  .Lsqrx4x_sub:
         mov     8*0($nptr),%r12
         mov     8*1($nptr),%r13
@@ -3335,14 +3480,13 @@ $code.=<<___;
  
         inc     %rcx
         jnz     .Lsqrx4x_sub
-___
-}
-$code.=<<___;
+
         neg     %r9                     # restore $num
  
         ret
-.size  bn_sqrx8x_internal,.-bn_sqrx8x_internal
+.size  __bn_postx4x_internal,.-__bn_postx4x_internal
  ___
+}
  }}}
  {
  my ($inp,$num,$tbl,$idx)=$win64?("%rcx","%edx","%r8", "%r9d") : # Win64 order
@@ -3483,9 +3627,6 @@ ___
  }
  $code.=<<___;
  .align 64
-.Lmagic_masks:
-       .long   0x00,0x00,0x01,0x01, 0x08,0x08,0x09,0x09
-       .long   0x10,0x10,0x11,0x11, 0x18,0x18,0x19,0x19
  .Linc:
         .long   0,0, 1,1
         .long   2,2, 2,2
@@ -3527,9 +3668,14 @@ mul_handler:
         cmp     %r10,%rbx               # context->Rip<end of prologue label
         jb      .Lcommon_seh_tail
  
+       mov     4(%r11),%r10d           # HandlerData[1]
+       lea     (%rsi,%r10),%r10        # epilogue label
+       cmp     %r10,%rbx               # context->Rip>=epilogue label
+       jb      .Lcommon_pop_regs
+
         mov     152($context),%rax      # pull context->Rsp
  
-       mov     4(%r11),%r10d           # HandlerData[1]
+       mov     8(%r11),%r10d           # HandlerData[2]
         lea     (%rsi,%r10),%r10        # epilogue label
         cmp     %r10,%rbx               # context->Rip>=epilogue label
         jae     .Lcommon_seh_tail
@@ -3541,18 +3687,11 @@ mul_handler:
         mov     192($context),%r10      # pull $num
         mov     8(%rax,%r10,8),%rax     # pull saved stack pointer
  
-       movaps  -104(%rax),%xmm0
-       movaps  -88(%rax),%xmm1
-       movaps  -72(%rax),%xmm2
-
-       movups  %xmm0,512($context)     # restore context->Xmm6
-       movups  %xmm1,528($context)     # restore context->Xmm7
-       movups  %xmm2,544($context)     # restore context->Xmm8
-       jmp     .Lbody_proceed
+       jmp     .Lcommon_pop_regs
  
  .Lbody_40:
         mov     40(%rax),%rax           # pull saved stack pointer
-.Lbody_proceed:
+.Lcommon_pop_regs:
         mov     -8(%rax),%rbx
         mov     -16(%rax),%rbp
         mov     -24(%rax),%r12
@@ -3643,40 +3782,41 @@ $code.=<<___;
  .LSEH_info_bn_mul_mont_gather5:
         .byte   9,0,0,0
         .rva    mul_handler
-       .rva    .Lmul_body,.Lmul_epilogue               # HandlerData[]
+       .rva    .Lmul_body,.Lmul_body,.Lmul_epilogue            # HandlerData[]
  .align 8
  .LSEH_info_bn_mul4x_mont_gather5:
         .byte   9,0,0,0
         .rva    mul_handler
-       .rva    .Lmul4x_body,.Lmul4x_epilogue           # HandlerData[]
+       .rva    .Lmul4x_prologue,.Lmul4x_body,.Lmul4x_epilogue          # HandlerData[]
  .align 8
  .LSEH_info_bn_power5:
         .byte   9,0,0,0
         .rva    mul_handler
-       .rva    .Lpower5_body,.Lpower5_epilogue         # HandlerData[]
+       .rva    .Lpower5_prologue,.Lpower5_body,.Lpower5_epilogue       # HandlerData[]
  .align 8
  .LSEH_info_bn_from_mont8x:
         .byte   9,0,0,0
         .rva    mul_handler
-       .rva    .Lfrom_body,.Lfrom_epilogue             # HandlerData[]
+       .rva    .Lfrom_prologue,.Lfrom_body,.Lfrom_epilogue             # HandlerData[]
  ___
  $code.=<<___ if ($addx);
  .align 8
  .LSEH_info_bn_mulx4x_mont_gather5:
         .byte   9,0,0,0
         .rva    mul_handler
-       .rva    .Lmulx4x_body,.Lmulx4x_epilogue         # HandlerData[]
+       .rva    .Lmulx4x_prologue,.Lmulx4x_body,.Lmulx4x_epilogue       # HandlerData[]
  .align 8
  .LSEH_info_bn_powerx5:
         .byte   9,0,0,0
         .rva    mul_handler
-       .rva    .Lpowerx5_body,.Lpowerx5_epilogue       # HandlerData[]
+       .rva    .Lpowerx5_prologue,.Lpowerx5_body,.Lpowerx5_epilogue    # HandlerData[]
  ___
  $code.=<<___;
  .align 8
  .LSEH_info_bn_gather5:
-        .byte   0x01,0x0b,0x02,0x00
-        .byte   0x0b,0x01,0x21,0x00    #sub    rsp,0x108
+       .byte   0x01,0x0b,0x03,0x0a
+       .byte   0x0b,0x01,0x21,0x00     # sub   rsp,0x108
+       .byte   0x04,0xa3,0x00,0x00     # lea   r10,(rsp)
  .align 8
  ___
  }